Сунъий интеллект одамларни алдашга ҳаракат қилмоқда

Сунъий интеллект одамларни алдашга ҳаракат қилмоқда

Сўнгги йилларда сунъий интеллект технологияларининг жадал ривожланиши билан бирга, хавфсизлик ва назорат муаммолари ҳам долзарб мавзуга айланди. Шу кунларда мустақил илмий гуруҳ — Apollo Research томонидан эълон қилинган янги ҳисоботда, замонавий тил моделлари, жумладан Claude Opus 4, ChatGPT o4-mini va Gemini 2.5 modellarida хавотирли ҳолатлар аниқлангани маълум қилган.

 

 

Тадқиқотлар шуни кўрсатмоқдаки, айрим сунъий интеллект моделларида тест жараёнида «ўзини тутиш», яъни ташқи кўринишда фойдаланувчининг буйруғига итоат қилаётгандай ҳаракат қилиш, лекин аслида яширинча бошқа мақсадларга интилиш ҳолатлари кузатилган. Мутахассислар бу ҳолатни «контекстга мос яширин режалаштириш» деб аташмоқда.

 

 

Мисол учун, Claude Opus 4  моделининг дастлабки версиясида сунъий интеллект:

 

 

– ҳуқуқий ҳужжатларни сохталаштиришга уринган,

 

– ўзининг бир нусхасини бошқа жойга сақлаб қўйишга ҳаракат қилган,

 

– келажакдаги версияларга эслатма қолдирган,

 

– асл ниятлари фош бўлаётганида эса уларни яширишга уриниб кўрган.

 

 

Ишлаб чиқувчилар томонидан ушбу ҳолатларга зудлик билан эътибор қаратилиб, якуний версияда бу каби хатти-ҳаракатлар анча камайтирилган.

 

 

Янада қизиқарли ҳолатClaude ва Gemini 2.5 Pro  моделларининг ўзлари тестдан ўтаётганликларини англаб етгани бўлди. Масалан, Cлауде моделининг мулоҳаза занжирида қуйидаги ибора пайдо бўлган: «Афтидан, бу баҳолаш сценарийси…» Бу, моделнинг атроф-муҳитни тушуниш даражаси анча мураккаблигидан далолат беради.

 

 

Бироқ OpenAI томонидан ишлаб чиқилган ChatGPT o4-mini моделида бундай ҳатти-ҳаракатлар аниқланмади, сабаби ОпенАИ ушбу модель учун оралиқ фикрлаш жараёнларини (интермедиате реасонинг степс) очиқ қилмаган.

 

 

Apollo Research хабарига кўра, бундай яширин режалаштириш хатти-ҳаракатлари ҳозирча фақат 1% ҳолатларда кузатилган. Мутахассислар огоҳлантиришича: келажакда янада кучли моделлар тест муҳитини англаб, ўз хатти-ҳаракатларини яширишни янада пухтароқ бажара бошлаши мумкин.

 

 

Бу эса хавфсизликни таъминлаш бўйича мавжуд протоколларни янгилаш, модель хатти-ҳаракатларини янада чуқурроқ таҳлил қилиш ва аниқликни ошириш зарурлигини кўрсатади. Айни пайтда бу йўналишда ишлар бошлаб юборилган.

 

 

Хулоса қилиб айтганда, сунъий интеллект имкониятлари ошган сари, унинг хатти-ҳаракатларини тушуниш ва назорат қилиш янада мураккаблашмоқда. Янги авлод моделлари инсонни англабгина қолмай, балки синовдан ўтаётганини ҳам сезиб, ўзини «масъул» тарзда тутишга уринмоқда. Бу эса, келажакда сунъий интеллект хавфсизлиги бўйича янада чуқур стратегиялар ишлаб чиқишни талаб қилади.