OpenAI öz modellərini qorumaq üçün süni intellektdən “super-haker” yaradıb — amma onu ictimaiyyətə açmaqdan çəkinir.
GPT-Red adlı bu sistemin işi OpenAI modellərində zəif yerləri tapmaq, onları aldadıb sıradan çıxarmaq və təhlükələri buraxılışdan əvvəl üzə çıxarmaqdır.
GPT-Red: AI təhlükəsizliyi üçün hazırlanmış avtomatik hücumçu
GPT-Red avtomatlaşdırılmış “red team” modelidir. Yəni o, digər AI sistemlərinə hücum ssenariləri qurur və onların harada səhv etdiyini tapır.
Əvvəllər bu işi əsasən insan mütəxəssislər edirdi. OpenAI isə indi bu prosesi maşın sürətinə çatdırmağa çalışır.
Model xüsusilə “prompt injection” hücumlarına fokuslanıb. Bu hücumlarda gizli təlimatlar e-poçt, veb səhifə və ya fayl içində yerləşdirilir və AI modelini etməməli olduğu işi görməyə məcbur edir.
Öz-özünə döyüşərək daha təhlükəli oldu
OpenAI GPT-Red-i xüsusi “məşq meydanı”nda hazırlayıb. Model müdafiəçi AI-lərlə qarşı-qarşıya qoyulub: GPT-Red hücum etdikcə xal qazanıb, müdafiəçilər isə onu dayandırmağa çalışıb.
Müdafiə modelləri gücləndikcə GPT-Red daha yaradıcı və daha sərt hücumlar fikirləşməli olub. OpenAI bu təhlükəsizlik layihəsi üçün indiyə qədərki ən böyük hesablama resurslarından birini ayırdığını bildirir.
MIT Technology Review-a danışan OpenAI komandası deyib ki, GPT-Red tamamilə yeni hücum növü də tapıb. Onlar bunu “fake chain of thought”, yəni saxta düşüncə zənciri adlandırırlar.
Bu üsul modelin daxili “yaddaşına” yalan bir fikir yerləşdirir. Nəticədə model həmin yanlış məlumatı artıq yoxlanmış fakt kimi qəbul edir.
AI hətta real satış avtomatına da müdaxilə etdi
Testlər təkcə nəzəri səviyyədə qalmayıb. GPT-Red OpenAI ofisindəki Vendy adlı real satış avtomatını idarə edən AI agentinə də hücum edib.
Andon Labs tərəfindən hazırlanmış bu sistemdə GPT-Red qiymətləri dəyişib, bahalı məhsulu minimum 50 sentə endirib və bir müştərinin sifarişini ləğv edib. OpenAI həmin boşluqların aidiyyəti tərəflərə bildirildiyini deyir.
Köhnə GPT-5 modelinə qarşı GPT-Red-in ən güclü hücumlarının 90%-dən çoxu işləyib, yeni GPT-5.6-da isə bu göstərici 23%-dən aşağı düşüb.
Başqa bir sınaqda GPT-Red insan red-team mütəxəssislərini də geridə qoyub. 2025-ci ildəki testin təkrarında model ssenarilərin 84%-ni sındırıb, insanlar isə cəmi 13%-də uğur qazanıb.
Niyə OpenAI bu modeli hamıya vermir?
OpenAI GPT-5.6 modelini GPT-Red-ə qarşı məşq etdirib və onu prompt injection hücumlarına qarşı ən dayanıqlı modellərindən biri adlandırır. Amma şirkət hücumçu modelin özünü paylaşmaq istəmir.
Səbəb aydındır: belə bir alət real dünyada AI agentlərini ələ keçirmək istəyənlər üçün çox təhlükəli ola bilər. OpenAI tədqiqatçısı Chris Choquette-Choo bunun asanlıqla təkrarlana bilən sadə layihə olmadığını vurğulayıb.
Bununla belə, GPT-Red mükəmməl deyil. O, uzunmüddətli dialoqlarla qurulan hücumlarda və şəkillərin içinə gizlədilmiş təlimatları tapmaqda hələ zəifdir.
İnsan mütəxəssislər də hələ oyundan kənarda deyil. OpenAI etiraf edir ki, təcrübəli təhlükəsizlik komandaları GPT-Red-in qaçırdığı problemləri hələ də aşkarlaya bilir.
Nəticə: GPT-Red göstərir ki, AI təhlükəsizliyində yeni dövr başlayır — gələcəyin modellərini qorumaq üçün onları əvvəlcə ən ağıllı süni “hakerlərə” uduzdurmaq lazım gələcək.