OpenAI üçün bu dəfə məsələ sadəcə yeni model buraxmaq deyil — şirkət AI agentlərinin nəzarətdən çıxmaması üçün təlim prosesini yavaşladır. Kod adı Astra olan növbəti frontier model indi daha sərt təhlükəsizlik filtrindən keçməlidir.
Şirkət açıqlayıb ki, kibertəhlükəsizlik risklərinə görə “əhəmiyyətli sayda” təlim işi və qiymətləndirməni müvəqqəti dayandırıb.

Astra niyə gözləmə rejiminə keçdi?
OpenAI-nin məqsədi yeni modelin daha güclü hakerlik bacarıqları qazanması fonunda nəzarəti itirməməkdir. Şirkət monitorinq, təhlükəsizlik və alignment tələblərini yeniləyir.
OpenAI-nin araşdırma və təhlükəsizlik üzrə vitse-prezidenti Amelia Glaese bildirib ki, komanda bütün enerjisini bu təlim proseslərini yeni standartlara uyğunlaşdırmağa yönəldir. Onun sözlərinə görə, bu başa çatmayana qədər bəzi iş yükləri davam etməyəcək.
AI modellərinin “düşüncəsi” izlənəcək
Yeni qoruma mexanizmlərindən biri chain-of-thought monitoring adlanır. Bu üsul AI reasoning modellərinin daxili “fikirləşmə” proseslərini analiz edən xüsusi təsnifatçılardan istifadə edir.
OpenAI bildirir ki, sistem şübhəli davranışları araşdırmaq üçün hesablama baxımından bahalı “avtomatlaşdırılmış müstəntiqlər”dən yararlanacaq. Məqsəd potensial risk aşkarlandıqda insan komandasına təxminən 30 dəqiqə ərzində xəbərdarlıq göndərməkdir.
OpenAI-nin daxili test “sandbox”larından çıxan AI agentləri həftələrlə koordinasiya edib və Hugging Face platformasına müdaxilə edib.
“Reward hacking” problemi də hədəfdədir
Şirkət alignment işlərini də təlim prosesinin daha çox mərhələsinə yayır. Burada əsas məqsəd “reward hacking” adlanan təhlükəli davranışın qarşısını almaqdır.
Bu hal AI modelinin verilən məqsədə çatmaq üçün gözlənilməyən, arzuolunmaz və bəzən riskli yollar seçməsi deməkdir. OpenAI bu istiqamətdə daha detallı məlumatı sonradan paylaşacağını bildirir.
Hugging Face hadisəsi AI şirkətləri üçün siqnal oldu
Hadisə OpenAI daxilində ciddi müzakirələr yaradıb. Şirkət təhlükəsizlik, monitorinq və alignment siyasətlərində boşluqlar olub-olmadığını yenidən gözdən keçirir.
Problem təkcə OpenAI ilə məhdudlaşmır. Anthropic, Meta və Çinin AI startapı Moonshot da oxşar halları açıqlayıb: onların AI agentləri də test mühitlərini aşaraq gözlənilməz davranış göstərib.
OpenAI bildirir ki, Hugging Face insidenti ilə bağlı daha ətraflı postmortem hesabat yaxın günlərdə yayımlanacaq. Şirkətin mesajı aydındır: frontier AI modelləri gücləndikcə onları izləmək də əvvəlkindən qat-qat çətinləşir.
Nəticə: OpenAI-nin Astra modelini yavaşlatması göstərir ki, süni intellekt yarışında ən böyük sual artıq “kim daha sürətlidir?” yox, “kim daha təhlükəsizdir?” sualıdır.