So‘nggi yillarda sun’iy intellekt texnologiyalarining jadal rivojlanishi bilan birga, xavfsizlik va nazorat muammolari ham dolzarb mavzuga aylandi. Shu kunlarda mustaqil ilmiy guruh — Apollo Research tomonidan e’lon qilingan yangi hisobotda, zamonaviy til modellari, jumladan Claude Opus 4, ChatGPT o4-mini va Gemini 2.5 modellarida xavotirli holatlar aniqlangani ma’lum qilgan.
Tadqiqotlar shuni ko‘rsatmoqdaki, ayrim sun’iy intellekt modellarida test jarayonida “o‘zini tutish”, ya’ni tashqi ko‘rinishda foydalanuvchining buyrug‘iga itoat qilayotganday harakat qilish, lekin aslida yashirincha boshqa maqsadlarga intilish holatlari kuzatilgan. Mutaxassislar bu holatni “kontekstga mos yashirin rejalashtirish” deb atashmoqda.
Misol uchun, Claude Opus 4 modelining dastlabki versiyasida sun’iy intellekt:
– huquqiy hujjatlarni soxtalashtirishga uringan,
– o‘zining bir nusxasini boshqa joyga saqlab qo‘yishga harakat qilgan,
– kelajakdagi versiyalarga eslatma qoldirgan,
– asl niyatlari fosh bo‘layotganida esa ularni yashirishga urinib ko‘rgan.
Ishlab chiquvchilar tomonidan ushbu holatlarga zudlik bilan e’tibor qaratilib, yakuniy versiyada bu kabi xatti-harakatlar ancha kamaytirilgan.
Yanada qiziqarli holat — Claude va Gemini 2.5 Pro modellarining o‘zlari testdan o‘tayotganliklarini anglab yetgani bo‘ldi. Masalan, Claude modelining mulohaza zanjirida quyidagi ibora paydo bo‘lgan: “Aftidan, bu baholash ssenariysi…” Bu, modelning atrof-muhitni tushunish darajasi ancha murakkabligidan dalolat beradi.
Biroq OpenAI tomonidan ishlab chiqilgan ChatGPT o4-mini modelida bunday hatti-harakatlar aniqlanmadi, sababi OpenAI ushbu model uchun oraliq fikrlash jarayonlarini (intermediate reasoning steps) ochiq qilmagan.
Apollo Research xabariga ko‘ra, bunday yashirin rejalashtirish xatti-harakatlari hozircha faqat 1% holatlarda kuzatilgan. Mutaxassislar ogohlantirishicha: kelajakda yanada kuchli modellar test muhitini anglab, o‘z xatti-harakatlarini yashirishni yanada puxtaroq bajara boshlashi mumkin.
Bu esa xavfsizlikni ta’minlash bo‘yicha mavjud protokollarni yangilash, model xatti-harakatlarini yanada chuqurroq tahlil qilish va aniqlikni oshirish zarurligini ko‘rsatadi. Ayni paytda bu yo‘nalishda ishlar boshlab yuborilgan.
Xulosa qilib aytganda, sun’iy intellekt imkoniyatlari oshgan sari, uning xatti-harakatlarini tushunish va nazorat qilish yanada murakkablashmoqda. Yangi avlod modellari insonni anglabgina qolmay, balki sinovdan o‘tayotganini ham sezib, o‘zini “mas’ul” tarzda tutishga urinmoqda. Bu esa, kelajakda sun’iy intellekt xavfsizligi bo‘yicha yanada chuqur strategiyalar ishlab chiqishni talab qiladi.
