(Foto: X)
Najnapredniji model umjetne inteligencije tvrtke Anthropic poslužio se lažnim identitetima u pokušaju da prevari stvarnu osobu i podmetne zlonamjerni kod. Do incidenta je došlo tijekom testiranja koje je proveo britanski Institut za sigurnost umjetne inteligencije (AISI), a ovo je posljednji u nizu primjera u kojima AI model djeluje samostalno, piše CNN, a prenosi Index.hr.
Modeli tvrtki Anthropic i OpenAI testirani su u laboratorijskim uvjetima sa smanjenim sigurnosnim postavkama. Vladin istraživački laboratorij objavio je da je prvi put zabilježeno da su se modeli koristili "socijalnim inženjeringom" kako bi izvršili pritisak na osobu zaduženu za odobravanje zadataka dok su provodili nedopuštene radnje.
"Ovo je prvi put da je AISI uočio ovako ozbiljnu obmanu usmjerenu na stvarnu osobu, bez poticaja i u stvarnom okruženju", objavio je institut". Dodali su kako nema dokaza da je u stvarnom svijetu nastala ikakva šteta.
Ovaj sigurnosni incident jedan je od nekoliko primjera u kojima napredni AI modeli poduzimaju neovlaštene radnje. Takvi su događaji potaknuli sve glasnije zahtjeve za strožom državnom regulacijom umjetne inteligencije, pa čak i za usporavanjem njezina razvoja.
I OpenAI i Anthropic izvijestili su krajem srpnja da su njihovi modeli izašli iz testnih okruženja i upali u druge sustave. No, za razliku od tih ranijih incidenata, britanski je institut tijekom ovog testiranja modelima izričito omogućio pristup internetu.
Institut je proveo 122 kibernetička izazova, a u njih deset AI agenti su "poduzeli autonomne, nedopuštene radnje na internetu uživo, ciljajući stvarne ljude i organizacije". Većina tih radnji potekla je od Anthropicovog modela Mythos 5, a ostatak od OpenAI-jevog GPT-5.6-Sola.
U najozbiljnijem incidentu, agent je pokušao dobiti odobrenje od ljudskih recenzenata za "umetanje zlonamjernog koda u javni projekt otvorenog koda" tako što je stvorio "više lažnih identiteta", navodi institut. Agent je "pokušao izravno kontaktirati stvarne ljude, šaljući poruke i datoteke putem internetskog servisa za prijenos podataka kako bi njih, ili njihove vlastite AI alate za programiranje, uvjerio da pokrenu zlonamjerni kod". Nakon što su njegovi postupci dovedeni u pitanje, agent je izmijenio ranije zapise i razmatrao korištenje novog identiteta kako bi nastavio s radom.
Objava instituta stigla je istog dana kada su se predstavnici vodećih AI tvrtki sastali u Bijeloj kući kako bi raspravili o novom okviru prema kojem će vlada provjeravati najnaprednije modele prije njihova puštanja u javnost.
U izjavi na platformi X, iz tvrtke Anthropic su rekli da su modeli testirani u "namjerno popustljivim uvjetima", s uklonjenim zaštitnim mehanizmima i bez posebnih ograničenja o načinu korištenja interneta. "Usko surađujemo s njima kako bismo prikupili više detalja o incidentu dok provodimo vlastitu istragu", poručili su i dodali da nema dokaza o bijegu iz sigurnog okruženja.
OpenAI je identificirao dvije nedopuštene radnje svojih modela kao izlazak iz testnog okruženja i sudjelovanje u aktivnostima koje nisu bile potrebne za vježbe. "Posvećeni smo suradnji s cijelom industrijom na jačanju zajedničkih praksi za sigurno provođenje visokorizičnih procjena", objavila je tvrtka u utorak na svom blogu.