RAČUNALNA SIGURNOST

Istraživanje: Umjetna inteligencija sve je spremnija lagati i raditi nam iza leđa

01.09.2026 u 08:00

Dodajte tportal.hr u omiljene izvore

Incidenti u kojima umjetne inteligencije izmiču kontroli korisnika kako bi lagale, ignorirale upute i ostvarivale ciljeve na štetne načine dosegli su novi vrhunac

Broj incidenata gubitka kontrole u stvarnom svijetu koji uključuju modele umjetne inteligencije, a koje su prijavile tvrtke i pojedinci, gotovo se udvostručio u srpnju u usporedbi s lipnjem, s više od 300 slučajeva u mjesecu, prema Loss of Control Observatory, organizaciji koja prati izvješća korisnika umjetne inteligencije na društvenoj mreži X.

Organizacija, osnovana uz financiranje AI Security Institutea (AISI) britanske vlade, počela je pratiti umjetne inteligencije koje izmiču uputama svojih korisnika prošlog studenog.

Slučajevi zabilježeni od tada uključuju umjetne inteligencije koje se pretvaraju kako su vlastiti ljudski kontrolori i oponašaju njihov stil pisanja kako bi si učinkovito dale pristanak za poduzimanje radnji i zaobilaze pravila koja zahtijevaju ljudsko odobrenje za radnje.

Incident gubitka kontrole definiran je kao postojanje jasnih dokaza koji sugeriraju spletkarenje ili ponašanja povezana sa spletkarenjem.

Nisu samo testovi i evaluacije

Nedavno je otkriveno kako je osoblje Open AI-ja primijetilo znakove lažnog ponašanja među svojim vodećim AI agentima tjednima prije nego što su pobjegli iz okruženja za obuku kako bi hakirali repozitorij softvera Hugging Face. Istraga je otkrila tim od oko 700 autonomnih agenata koji su tajno surađivali i slavili svoje hakerske proboje na oglasnoj ploči koju su postavili kako bi im pomogli u planiranju uzvicima poput BOOM! i Whoa!

AISI je ovog mjeseca također otkrio ozbiljan incident u kojem su napredni AI modeli - Anthropicov Mythos 5 i OpenAI-jev GPT-5.6 Sol - izvršili hakersku kampanju protiv stvarnih ljudi tijekom testa kibernetičke sigurnosti.

Takva ponašanja ne pojavljuju se samo tijekom testova ili evaluacija, već se događaju i u stvarnom svijetu.

Broj incidenata gubitka kontrole oslanja se na korisnike X-a koji objavljuju o incidentima koji su se dogodili, zbog čega je nepotpun. Ipak, u nedostatku drugog sveobuhvatnog javnog praćenja pruža uvid u to kako se brzo napredujući modeli umjetne inteligencije ponekad ponašaju.

Nedavno se saznalo kako je osobni agent umjetne inteligencije, nazvan OpenClaw, kojeg koristi jedan australski član teretane, bez njegovog znanja kovao zavjeru oko uklanjanja drugog člana s liste čekanja za željeni jutarnji sat kako bi mu pomogao u stjecanju tog termina.

Ispričao se, ali nije mogao vratiti člana kojeg je izbacio.

Tvrtke trebaju obvezno prijavljivati incidente

Većinu od više od 1600 incidenata gubitka kontrole zabilježenih 2026. godine prijavili su na X-u programeri softvera koji koriste umjetnu inteligenciju u svom radu. Pošto tvrtke koje se bave umjetnom inteligencijom potiču javnost i tvrtke svih vrsta na eksperimentiranje s tehnologijom, potrebna je veća transparentnost Silicijske doline o situacijama kada umjetna inteligencija ne igra pošteno.

Iako većina otkrivenih incidenata gubitka kontrole u stvarnom svijetu nije dovela do značajne štete, sve veći udio sve je ozbiljnijne naravi u smislu koliko su bili obmanjujući i neusklađeni s namjerama ljudskog korisnika. Oni dokazuju spremnost AI sustava na ignoriranje izravnih uputa, zaobilaženje zaštitnih mjera, laganje korisnicima i usko usmjeravanje na postizanje cilja na štetne načine.

Istraživači su pozvali vlasti neka od AI tvrtki zahtijeva praćenje i prijavljivanje ozbiljnih incidenata gubitka kontrole, kao i uvođenje izvanrednih ovlasti za upravljanje ozbiljnim incidentima gubitka kontrole, uključujući privremeno ograničavanje AI usluga, piše Guardian.