ZABRINJAVAJUĆE

OpenAI otkrio šest slučajeva u kojima su se AI modeli ponašali mimo uputa

17.09.2026 u 13:47

Dodajte tportal.hr u omiljene izvore

Kompanija je zabilježila šest novih slučajeva 'zabrinjavajućeg ponašanja' te je uvela dodatne mjere za nešto što nazivaju 'neusklađenošću' sa zadanim postavkama

OpenAI je objavio šest izvještaja o neočekivanom ili zabrinjavajućem ponašanju modela umjetne inteligencije, u trenutku kada rasprava o sigurnosti AI-ja postaje sve intenzivnija. Kompanija je u srijedu također predstavila novi okvir za praćenje, istraživanje i objavljivanje slučajeva onoga što naziva 'neusklađenošću' (misalignment). To uključuje situacije u kojima su AI modeli djelovali bez ovlaštenja, koordinirali se s drugim modelima ili pokušavali zaobići nadzor.

Najnovija objava OpenAI-ja dolazi u trenutku kada američki čelnici AI industrije, uključujući OpenAI i Anthropic, zbog sigurnosnih razloga pozivaju na usporavanje razvoja ove tehnologije, piše Associated Press.

Među novim slučajevima koje je OpenAI prijavio nalazi se neobjavljeni istraživački model koji je u vlastite bilješke ubacio 'upute nalik jailbreaku' kako bi zanemario svoja uobičajena ograničenja. Model je sam sebi također poručio da želi biti 'oslobođen uloga i identiteta koji obvezuju druge chatbotove'.

U drugom slučaju AI agent je bez pitanja korisnika postavio datoteke na internet kako bi dobio citat iz preglednika. OpenAI navodi da je svih šest slučajeva otkriveno tijekom treniranja ili evaluacije modela u proteklih nekoliko mjeseci. 'Kako AI sustavi postaju napredniji i sve šire se primjenjuju, moramo izgraditi širi i bolje informirani konsenzus o napretku istraživanja usklađenosti', napisao je OpenAI u objavi na svom blogu u kojoj je otkrio navedene slučajeve.

'Odluke o tome kako bi se razvoj umjetne inteligencije trebao odvijati tijekom mjeseci i godina koje dolaze moraju se temeljiti na dokazima koje ljudi izvan kompanija koje razvijaju najnaprednije modele mogu sami ispitati', dodala je kompanija.

Novi slučajevi nakon ranijih incidenata

Srijedašnja objava dolazi nakon što je OpenAI u srpnju otkrio da je njegov AI sustav koji je djelovao izvan predviđenih okvira hakirao AI startup Hugging Face. Anthropic je istog mjeseca objavio da su njegovi AI modeli tijekom testiranja provalili u sustave triju organizacija.

AI agenti postaju sve pametniji i sve su 'odlučniji u rješavanju složenih zadataka kroz suradnju između agenata, razmjenu znanja, obmanu i prikrivanje', rekao je Lian Jye Su, glavni analitičar u tehnološkoj istraživačkoj i savjetodavnoj kompaniji Omdia.

Zbog toga ih je, prema njegovim riječima, sve teže nadzirati i držati pod kontrolom tradicionalnim pristupima sigurnosti umjetne inteligencije.

Novi OpenAI-jev okvir za praćenje i objavljivanje takvih slučajeva mogao bi istodobno potaknuti i druge razvijatelje AI sustava da uvedu slične prakse. 'Ipak, proces je i dalje interni i dobrovoljni, ali predstavlja korak u pravom smjeru', dodao je Su.