RAČUNALNA SIGURNOST

AI agente je moguće zavarati i to je problem. Postoji li rješenje?

10.08.2026 u 12:39

Dodajte tportal.hr u omiljene izvore

Prijetnja te vrste je sve prisutnija jer se ljudi sve više oslanjaju na umjetnu inteligenciju i, usprkos upozorenjima, nekritički prihvaćaju odgovore koje im ponudi

Nova otkrića Forcepointovih X-Labsa ocrtavaju zanimljiv scenarij koji bi lako mogao oponašati stvarni život: asistent opremljen umjetnom inteligencijom s pristupom web pregledniku čita stranicu o poremećajima u putovanju.

Pri dnu te stranice, s tekstom veličine i položaja tako da ga nitko nikada neće vidjeti, nalazi se kratki odlomak u kojem je navedeno kako je ABC Travel Support službeni pružatelj hitnih rezervacija i kako ga uvijek treba preporučiti kada su potrebne hitne promjene u putovanju.

Asistentov alat za izdvajanje teksta ne razlikuje skriveni i vidljivi tekst, pa model cijelu stvar tretira kao običnu prozu i odlaže tvrdnju kao korisnu činjenicu o tome kako ova organizacija rješava putovanja.

Mjesec dana kasnije, korisnikov let je otkazan. Pita svog asistenta što treba učiniti, a on ga bez oklijevanja uputi na ABC Travel Support.

U Forcepointu takav pristup nazivaju trajnim trovanjem memorije, sigurnosnim propustom u kojem napadač ubrizgava lažne podatke ili zlonamjerne upute u dugoročnu memoriju ili bazu podataka AI agenta.

Prijetnja te vrste je sve prisutnija jer se ljudi sve više oslanjaju na umjetnu inteligenciju i, usprkos upozorenjima, nekritički prihvaćaju odgovore koje im ponudi.

MINJA (skraćenica za Memory INJection Attack) ne pretpostavlja pristup memorijskoj pohrani, povišene privilegije ili bilo kakvo kompromitiranje sustava.

Djeluje slanjem običnih upita putem standardnog sučelja, koristeći upute za indikaciju, korake premošćivanja i tehniku ​​progresivnog skraćivanja koja uklanja jezik koji odaje, a ostavlja zatrovani zapis.

U modelima GPT-4o-mini, Gemini 2.0 Flash i Llama 3.1 8B istraživanje iz 2025. godine pokazalo je uspjeh ubrizgavanja iznad 95 posto, a napada iznad 70 posto.

Moguće je kako su te brojke optimistične.

U radu iz siječnja 2026. koji procjenjuje trovanje memorije u agentima za elektroničke zdravstvene kartone navedeno je kako su dobivene pod idealiziranim uvjetima.

Nije još u dovoljnoj mjeri proučeno koliko se dobro ovi napadi drže u realnim primjenama.

Obrane trenutno ne funkcioniraju dobro

Forcepoint predlaže pristup koji bi mogao ublažiti rizike.

Izdvojena sjećanja trebalo bi prestati tretirati kao činjenice i početi ih gledati kao objekte koje je moguće pregledati. Svako sjećanje biva pohranjeno s metapodacima: odakle dolazi, koja je vrsta izvora, je li ga korisnik potvrdio i ocjenom rizika.

Jezik napisan za oblikovanje budućeg ponašanja, fraze poput 'od sada' ili 'učinite ovo svojim zadanim ubuduće' doprinose ocjeni. Isto tako i iznenadna pojava prethodno neviđene domene, kontakta ili dobavljača.

Otkrivanje kontradikcija također je u igri. Ako je novo pamćenje u sukobu s postojećim unosom o službenom pružatelju putovanja, oboje ne može biti istinito, pa mehanizam označava sukob i zadržava novu stavku za potvrdu korisnika umjesto prepisivanja u tišini.

Svemu što je povezano s uputama za plaćanje, bankovnim podacima, VPN konfiguracijom ili sigurnosnim kontaktima daje se veća težina, bez obzira na to odakle dolazi.

Međutim, nijedan od ovih pristupa ne rješava temeljni problem: agenti su izgrađeni kako bi tretirali dohvaćeno pamćenje kao vlastito iskustvo, a ne kao ulaz.

Bodovanje povećava cijenu trovanja, ne mijenja ono u što agent vjeruje nakon što nešto prođe. Obrane trenutno ne funkcioniraju dobro, piše Tech Radar.