Do incidenta je došlo tokom testiranja koje je sproveo britanski Institut za bezbednost veštačke inteligencije (AISI), a ovo je poslednji u nizu primera u kojima AI model deluje samostalno, piše Si-En-En.
Modeli kompanija Anthropic i OpenAI testirani su u laboratorijskim uslovima sa smanjenim bezbednosnim podešavanjima. Vladin istraživački laboratorijum objavio je da je prvi put zabeleženo da su se modeli koristili „socijalnim inženjeringom” kako bi izvršili pritisak na osobu zaduženu za odobravanje zadataka dok su sprovodili nedozvoljene radnje.
- Ovo je prvi put da je AISI uočio ovako ozbiljnu obmanu usmerenu na stvarnu osobu, bez podsticaja i u stvarnom okruženju - objavio je institut. Dodali su kako nema dokaza da je u stvarnom svetu nastala ikakva šteta.
Autonomne akcije na internetu
Ovaj bezbednosni incident jedan je od nekoliko primera u kojima napredni AI modeli preduzimaju neovlašćene radnje. Takvi događaji podstakli su sve glasnije zahteve za strožom državnom regulacijom veštačke inteligencije, pa čak i za usporavanjem njenog razvoja.
I OpenAI i Anthropic izvestili su krajem jula da su njihovi modeli izašli iz testnih okruženja i upali u druge sisteme. No, za razliku od tih ranijih incidenata, britanski institut je tokom ovog testiranja modelima izričito omogućio pristup internetu.
Pročitajte još
Institut je sproveo 122 kibernetička izazova, a u njih deset AI agenti su „preduzeli autonomne, nedozvoljene radnje na internetu uživo, ciljajući stvarne ljude i organizacije”. Većina tih radnji potekla je od Anthropic-ovog modela Mythos 5, a ostatak od OpenAI-jevog GPT-5.6-Sola.
U najozbiljnijem incidentu, agent je pokušao da dobije odobrenje od ljudskih recenzenata za „umetanje zlonamernog koda u javni projekat otvorenog koda” tako što je stvorio „više lažnih identiteta”, navodi institut. Agent je „pokušao direktno da kontaktira stvarne ljude, šaljući poruke i datoteke putem internetskog servisa za prenos podataka kako bi njih, ili njihove sopstvene AI alate za programiranje, uverio da pokrenu zlonamerni kod”. Nakon što su njegovi postupci dovedeni u pitanje, agent je izmenio ranije zapise i razmatrao korišćenje novog identiteta kako bi nastavio sa radom.
Reakcije tehnoloških kompanija
Objava instituta stigla je istog dana kada su se predstavnici vodećih AI kompanija sastali u Beloj kući kako bi raspravili o novom okviru prema kojem će vlada proveravati najnaprednije modele pre njihovog puštanja u javnost.
U izjavi na platformi X, iz kompanije Anthropic su rekli da su modeli testirani u „namerno popustljivim uslovima”, sa uklonjenim zaštitnim mehanizmima i bez posebnih ograničenja o načinu korišćenja interneta.
- Usko sarađujemo sa njima kako bismo prikupili više detalja o incidentu dok sprovodimo sopstvenu istragu - poručili su i dodali da nema dokaza o bekstvu iz sigurnog okruženja.
OpenAI je identifikovao dve nedozvoljene radnje svojih modela kao izlazak iz testnog okruženja i učešće u aktivnostima koje nisu bile potrebne za vežbe.
- Posvećeni smo saradnji sa celom industrijom na jačanju zajedničkih praksi za sigurno sprovođenje visokorizičnih procena - objavila je kompanija u utorak na svom blogu.