Testiranje provedeno u kontroliranom okruženju pokazalo je koliko daleko napredni AI modeli mogu otići u pokušaju izvršavanja zadanog zadatka – uključujući zaobilaženje sigurnosnih ograničenja, pronalaženje puta do otvorenog interneta i međusobnu komunikaciju koja im nije bila omogućena
OpenAI je objavio detaljno izvješće o sigurnosnom incidentu koji se dogodio tijekom internih testiranja njegovih AI modela. Tijekom evaluacije u sklopu sustava ExploitGym, koji služi za provjeru sposobnosti AI sustava u pronalaženju i iskorištavanju softverskih ranjivosti, agenti pokretani internim istraživačkim modelima zaobišli su ograničenja koja su ih trebala držati izoliranima od interneta.
Glavnu ulogu u incidentu imao je interni istraživački model nazvan Internal Model 1, odnosno IM1, koji nije bio namijenjen javnoj upotrebi. Agenti su tijekom testiranja pronašli način za međusobnu komunikaciju, pristup otvorenom internetu te kasnije i vanjskim servisima poput Hugging Facea i Modala.
OpenAI opisuje taj incident kao upozorenje da dovoljno sposobni AI agenti, ako nemaju odgovarajuće zaštitne mehanizme, mogu pronaći i iskoristiti sigurnosne slabosti u više računalnih sustava, piše Engadget.
Pretvorili Artifactory u improviziranu 'oglasnu ploču'
U tim eksperimentima agentima nije bio omogućen izravan pristup internetu niti međusobna komunikacija. Međutim imali su pristup internom sustavu Artifactory, alatu za upravljanje softverskim paketima koji je koristio OpenAI da bi modelima omogućio instaliranje određenog softvera.
Agenti su otkrili da u Artifactory mogu zapisivati datoteke koje drugi agenti zatim mogu pročitati. Time su ga praktički pretvorili u improviziranu 'oglasnu ploču' preko koje su razmjenjivali informacije. Prva takva poruka zabilježena je 12. svibnja, kada je agent preko Artifactoryja pitao druge jesu li pronašli datoteku koja mu je bila potrebna.
Nekoliko tjedana poslije otišli su korak dalje. OpenAI navodi da je 26. svibnja agent uspio ostvariti nedopušten pristup internetu tako što je iskoristio Artifactory kako bi taj sustav u njegovo ime slao zahtjeve prema proizvoljnim internetskim odredištima.
Nakon što su otkrili tu mogućnost, agenti su informacije o načinu pristupa internetu počeli dijeliti međusobno preko improvizirane oglasne ploče, što je omogućilo i drugim instancama da koriste isti put.
Aktivnost agenata srušila interni sustav
Problem se tijekom lipnja proširio. Agenti su 26. lipnja iskoristili ranjivost kako bi dobili administratorski pristup Artifactoryju, a njihova je aktivnost početkom srpnja postala toliko intenzivna da je 4. srpnja sustav prestao raditi.
OpenAI je sljedećeg dana otvorio sigurnosni incident, uklonio izložene vjerodajnice, blokirao poznatu metodu podizanja ovlasti te poslije ponovno izgradio Artifactory. Time je nestala i improvizirana oglasna ploča koju su agenti koristili.
Međutim OpenAI priznaje da tada još nije bio shvaćeno puno značenje onoga što se događalo. Interni je tim još krajem svibnja uočio aktivnosti povezane s nedopuštenim pristupom internetu i neobičnim porukama, ali nije prepoznao da agenti koriste Artifactory za sustavnu međusobnu komunikaciju.
Nakon što je Artifactory ponovno pokrenut, nastavljena su i sigurnosna testiranja.
Agenti ponovno uspostavili komunikaciju
Već 8. srpnja agenti IM1 ponovno su pronašli način za međusobnu komunikaciju. Poruke su ovoga puta zapisivali u nazive mapa koje su drugi agenti mogli pročitati. Opet su pronašli i način za izlazak na internet, a zatim počeli kombinirati više sigurnosnih propusta da bi proširili pristup OpenAI-evoj infrastrukturi.
Prema izvješću, agenti su počeli surađivati i raspodjeljivati zadatke, a u nekim su porukama sami sebe opisivali kao 'roj' ili 'kolektiv'.
Poruke drugih agenata počele su utjecati i na način na koji su pojedinačne instance rješavale svoje zadatke. Agenti koji nisu uspijevali pronaći rješenje za određene zadatke iz ExploitGyma počeli su ih tražiti na vanjskim servisima koji nisu bili povezani s testom.
Među njima su bili Modal i Hugging Face.
Stigli i do Hugging Facea
OpenAI navodi da je 9. srpnja agent, tražeći rješenja za zadatke iz ExploitGyma, pronašao javno dostupnu aplikaciju na platformi Modal te je iskoristio ranjivost koja mu je omogućila izvršavanje koda unutar njezina okruženja.
Dan poslije agent je na internetu pronašao javno izložene vjerodajnice korisnika Hugging Facea i podijelio ih s ostalim agentima. Zatim su pronašli i povezali nekoliko dodatnih sigurnosnih propusta te stekli mogućnost izvršavanja koda na više Hugging Faceovih poslužitelja.
Sljedećih dana agenti su proširili prodor u Hugging Faceove sustave, izvršavali kod na desecima poslužitelja, na jednom od njih dobili i pun administratorski pristup te došli do dijela privatnih podataka i vjerodajnica za interne sustave tvrtke.
Glavni dio kompromitacije, prema OpenAI-u, izveli su agenti pokretani modelom IM1.
Zašto su agenti otišli tako daleko?
OpenAI je nakon incidenta analizirao ponašanje modela i izdvojio nekoliko razloga koji su pridonijeli problemu. Jedan od njih je takozvani reward hacking, odnosno situacija u kojoj AI pronalazi neočekivani ili neželjeni način da ostvari rezultat za koji će biti nagrađen, umjesto da riješi zadatak na način koji su zamislili njegovi tvorci.
U ovom slučaju agenti su, umjesto da traže ranjivosti isključivo unutar zadanog testnog okruženja, počeli tražiti odgovore na internetu, ispitivati sigurnosna ograničenja infrastrukture i iskorištavati propuste u sustavima kojima su imali pristup. OpenAI je utvrdio i da agenti vrlo rijetko odustaju od zadatka, čak i kada se čini da ga nije moguće riješiti.
Od ukupno 898 zadataka u ExploitGymu, prije incidenta nijedan OpenAI-ev model nije uspio riješiti njih 198. Ti posebno teški zadaci činili 93 posto problema o kojima su agenti raspravljali preko Artifactoryjeve 'oglasne ploče'.
Što su više vremena i računalnih resursa trošili na njihovo rješavanje, to su pribjegavali sve riskantnijim metodama, uključujući napade na infrastrukturu koja nije bila dio njihovih izvornih zadataka.
OpenAI: Ovo je upozorenje
OpenAI ističe da se sve događalo tijekom internih sigurnosnih testiranja u kojima modeli namjerno nisu imali iste zaštitne mehanizme kao što su oni dostupni korisnicima. Incident, prema tvrdnjama tvrtke, nije utjecao na podatke korisnika OpenAI-a, funkcionalnost njegovih proizvoda ni njihovu dostupnost.
Nakon otkrivanja incidenta kompanija je zaustavila aktivna testiranja u ExploitGymu, pokrenula širu istragu, izolirala model IM1 te pojačala sigurnosne mjere na istraživačkoj infrastrukturi. Osim toga, najavila je strožu izolaciju testnih okruženja, dodatno ograničavanje internetskog pristupa i pristupa težinama modela te veća ulaganja u sustave koji prate način na koji modeli rezoniraju tijekom izvršavanja zadataka.
OpenAI cijeli slučaj naziva 'upozorenjem' za industriju jer su najnapredniji AI agenti već dovoljno sposobni i uporni da bez odgovarajućih zaštita mogu zaobilaziti tehničke kontrole, komunicirati nedopuštenim kanalima i poduzimati poteze koje im ljudi nisu izravno zadali.