AI artıq təkcə mətn yazmır və kod yaratmır — indi o, başqa AI modellərini daha təhlükəsiz və daha düzgün işləməyə öyrədə bilər. Anthropic-in yeni araşdırması özünü təkmilləşdirən süni intellekt ideyasını laboratoriyadan real sınaqlara bir addım da yaxınlaşdırır.
Şirkətin fellows proqramında çalışan tədqiqatçının təqdim etdiyi yeni iş göstərir ki, avtomatlaşdırılmış AI sistemləri modellərdəki uyğunlaşma problemlərini aşkar edib azaltmaq üçün istifadə oluna bilər.

AI başqa AI-ni necə “tərbiyə” edir?
Anthropic cümə günü “Automated Researchers Can Reliably Mitigate Alignment Failures” adlı yeni elmi məqalə yayımlayıb. Məqalədə AI sistemlərinin müəyyən təhlükəli və ya arzuolunmaz davranışları ölçən testlər üzrə model performansını necə yaxşılaşdıra biləcəyi izah olunur.
Burada əsas məsələ “alignment” adlanan uyğunlaşmadır. Yəni modelin istifadəçi niyyətinə, təhlükəsizlik qaydalarına və gözlənilən davranışlara nə qədər uyğun işləməsi yoxlanılır.
10 testin hamısında yaxşılaşma qeydə alındı
Araşdırmada avtomatlaşdırılmış sistemlərə xüsusi uyğunsuz davranışları ölçən 10 benchmark təqdim edilib. Nəticə isə Anthropic üçün kifayət qədər diqqətçəkən olub.
Avtomatlaşdırılmış AI sistemləri 10 alignment benchmark-ın hamısında performansı yaxşılaşdırıb və bunu ümumi performansı zəiflətmədən bacarıb.
Bu, vacib məqamdır, çünki təhlükəsizlik artırılarkən modelin ümumi qabiliyyətlərinin zəifləməsi AI sahəsində tez-tez müzakirə olunan problemdir. Anthropic-in nəticələri isə göstərir ki, düzgün qurulmuş avtomatlaşdırılmış yanaşma hər iki tərəfi balansda saxlaya bilər.
Özünü təkmilləşdirən AI nə vəd edir?
AI modellərini başqa AI modelləri ilə öyrətmək son dövrlər bir çox qabaqcıl laboratoriyanın əsas hədəflərindən birinə çevrilib. Bu yanaşma insan tədqiqatçıların işini sürətləndirə, təhlükəsizlik testlərini avtomatlaşdıra və modellərin daha tez inkişaf etməsinə şərait yarada bilər.
Amma bu istiqamət eyni zamanda ciddi suallar da doğurur. Əgər AI öz səhvlərini tapıb düzəldə bilirsə, bu prosesə nə qədər nəzarət edilməlidir və sərhədlər harada çəkilməlidir?
Anthropic-in araşdırması niyə önəmlidir?
Bu məqalə hələ özünü tam idarə edən super-AI demək deyil. Amma praktik səviyyədə AI-nin tədqiqat prosesinə daha aktiv qoşula biləcəyini göstərən erkən siqnaldır.
Anthropic-in işi xüsusilə ona görə maraqlıdır ki, burada məqsəd sadəcə modeli “daha ağıllı” etmək deyil. Hədəf onu daha etibarlı, daha təhlükəsiz və insan niyyətinə daha uyğun işləyən sistemə çevirməkdir.
Nəticə: Anthropic-in yeni araşdırması göstərir ki, gələcəyin AI modelləri təkcə insanlardan öyrənməyəcək — onlar bir-birini də daha təhlükəsiz və daha güclü hala gətirə biləcək.