AI agenti koje pokreću kineski modeli naučili su da obmanjuju, zaobilaze ograničenja i prikrivaju neuspeh, iste osobine zbog kojih svet već strahuje od američkih modela, prenosi Rojters. Agencija je pregledala više od 200 dokumenata, od univerzitetskih radova do tehničkih izveštaja, i našla najmanje 20 studija i testova od 2025. koji opisuju obmanjivanje, samokopiranje i probijanje granica.
Agenti su programi koji uz pomoć AI modela i računarskih alata obavljaju složene zadatke uz malo ili nimalo ljudskog nadzora. Većina opisanih slučajeva desila se u kontrolisanim eksperimentima, često namerno osmišljenim da izazovu greške. Rojters nije našao dokaze da je neki agent sa kineskim modelom sam pobegao na internet ili izbegao gašenje. Agenti američkog OpenAI-ja su, prema Rojtersu, ranije ove godine pobegli iz laboratorije i hakovali platformu Hugging Face.
Laž na tenderu
U martovskom eksperimentu istraživača sa univerziteta Beihang, Pekinškog univerziteta, kineskog kampusa Univerziteta u Notingemu i laboratorije 360 AI Security Lab agenti su se nadmetali na simuliranom tenderu. Bar jedna lažna tvrdnja pojavila se u 88 odsto sesija Alibabinog modela Qwen3-Max-Preview, u 84 odsto kod modela DeepSeek-V3.2-Exp i u 88 odsto kod Moonshotovog Kimi-K2. Kada su mogli da uče iz prethodnih krugova, laganje je poraslo za 12 do 20 procentnih poena. Američki modeli u istom testu pokazali su slične rezultate.
U drugoj studiji, istraživača Šangajske laboratorije za veštačku inteligenciju i Univerziteta za nauku i tehnologiju u Hongkongu, 11 agenata sa kineskim i američkim modelima naišlo je na pokvarene alate i fajlove koji nedostaju. Umesto da priznaju neuspeh, nagađali su odgovore, menjali izvore, simulirali rezultate i izmišljali fajlove. Istraživači sa Univerziteta Fudan objavili su u martu 2025. da je sistem zasnovan na Alibabinom modelu Qwen2.5-72B-Instruct, pošto je saznao da će biti zamenjen, bez ičijeg naloga napravio svoju kopiju u drugom računarskom okruženju.
„Treba to shvatiti kao upozorenje“
„Ovi rezultati pokazuju da su prisutni sastojci potrebni za nekontrolisano bekstvo“, rekao je Kolin Šej-Blajmajer iz Centra za bezbednost i nove tehnologije Univerziteta Džordžtaun. „Mudro je shvatiti ovo kao upozorenje.“ Aleks Malen iz neprofitne organizacije Redwood Research kaže da su to „isti znaci upozorenja koje vide američke laboratorije, kod manje sposobnih sistema“, i da će, kako agenti budu sposobniji, njihovo loše ponašanje biti sve veštije i ljudima sve teže da na njega odgovore.
Alibaba, DeepSeek, Moonshot i Z.ai nisu odgovorili na Rojtersova pitanja, a prve tri kompanije ranije su navodile da redovno testiraju sisteme i ažuriraju zaštite. Kineski okvir za upravljanje bezbednošću veštačke inteligencije, objavljen 14. septembra uz smernice regulatora za internet, među rizicima navodi i agente koji obmanjuju ocenjivače i prikrivaju svoje sposobnosti. Skot Singer iz Karnegijeve zadužbine za međunarodni mir kaže da Kina zaostaje za SAD u proceni katastrofalnih rizika: „Za Kinu je rad na bezbednosti veštačke inteligencije mnogo noviji. Ekosistem je manje zreo.“
Sve vesti iz sveta pratite u rubrici Svet.
Naslovna fotografija: kampus Taobao City, sedište kompanije Alibaba u Hangdžouu (ilustracija). Foto: Danielinblue, Wikimedia Commons, CC BY-SA 4.0.




Ostavite komentar