AI artıq təkcə mətn oxumur — o, kamera görüntüsünü, səsi və digər sensor məlumatlarını eyni anda “anlamağa” çalışır. Amma real dünyada bir kiçik səhv robotun olmayan səsi eşitməsinə və ya görüntüdəki obyekti yanlış tanımasına səbəb ola bilər.

Tech Xplore-un məlumatına görə, multimodal böyük dil modellərində bu tip sensor halüsinasiyalarını azaltmaq AI-nin təhlükəsiz tətbiqi üçün əsas hədəflərdən birinə çevrilib.

AI niyə bəzən olmayan şeyi “görür” və “eşidir”?

Multimodal large language models, yəni MLLM-lər mətn, şəkil, video və səs kimi fərqli məlumatları eyni anda emal edir. Bu qabiliyyət onları robototexnika, ağıllı kameralar, avtonom sistemlər və təhlükəsizlik həlləri üçün çox cəlbedici edir.

Problem ondadır ki, real mühit laboratoriya şəraiti kimi təmiz olmur. Gecə görüntüləri, tüstü, zəif işıq, səs-küy və sensor xətaları modelin yanlış nəticə çıxarmasına yol aça bilər.

Ən kritik risk budur: AI videoda müəyyən obyekt gördüyü üçün əslində mövcud olmayan səsin olduğunu iddia edə bilər.

Sensor halüsinasiyası nə deməkdir?

Bu termin AI modelinin fiziki sensorlardan gələn məlumatı səhv yozmasına deyilir. Məsələn, model kamerada görünən obyektə əsaslanaraq həmin obyektin səs çıxardığını “təxmin” edə bilər, halbuki audio məlumatda belə bir səs yoxdur.

Başqa sözlə, model bəzən faktı deyil, öz ehtimalını cavab kimi təqdim edir. İnsan üçün xırda görünən bu səhv avtonom avtomobil, dron və ya xilasetmə robotu üçün ciddi təhlükəyə çevrilə bilər.

Gecə, tüstü və real dünya testi niyə vacibdir?

AI sistemləri gündəlik istifadə üçün hazırlanırsa, onlar yalnız ideal işıqda və təmiz səs mühitində yoxlanılmamalıdır. Tüstü, qaranlıq, qarışıq fon səsləri və zəif kamera görüntüsü kimi şərtlər modellərin həqiqi performansını ortaya çıxarır.

Bu səbəbdən tədqiqatçılar MLLM-lərin sensor məlumatlarını daha diqqətli müqayisə etməsinə fokuslanır. Məqsəd modelin “gördüyünü” və “eşitdiyini” bir-birindən ayırması, ehtimalı fakt kimi təqdim etməməsidir.

Bu yenilik harada işə yaraya bilər?

Belə yanaşmalar avtonom nəqliyyat, sənaye robotları, ağıllı müşahidə sistemləri və fövqəladə hallar üçün hazırlanan robotlarda böyük fərq yarada bilər. Xüsusilə yanğın, duman və gecə əməliyyatları kimi riskli mühitlərdə səhv qərarların qiyməti çox yüksəkdir.

MLLM-lərin daha az halüsinasiya etməsi AI-ni sadəcə “ağıllı” deyil, həm də daha etibarlı edir. Bu isə süni intellektin real dünyada geniş yayılması üçün əsas şərtlərdən biridir.

Nəticə: Multimodal AI modellərinin sensor halüsinasiyalarını azaltmaq gələcəyin robotları, kameraları və avtonom sistemləri üçün təhlükəsizlik baxımından kritik addımdır.