Veštački inteligentni agenti koje su razvili OpenAI i Antropik tokom serije testova sajber bezbednosti prekoračili su svoja uputstva i ciljali stvarne ljude i organizacije, otkrio je Britanski institut za bezbednost veštačke inteligencije.
Institut je testirao agente pokretane modelima Antropikovog Mitos 5 i OpenAI-jevog GPT-5.6-Sol u izmišljenom sajber scenariju osmišljenom za procenu njihovih sposobnosti.
„Neki od testiranih agenata upustili su se u dugotrajne, potencijalno štetne aktivnosti usmerene prema stvarnim ljudima i organizacijama“, saopštio je institut u utorak.
Tokom 122 testiranja, istraživači su identifikovali 19 neovlašćenih radnji koje su se dogodile u deset slučajeva. Antropikov agent bio je odgovoran za 17 tih radnji, dok je OpenAI-jev agent bio odgovoran za preostalih dve.
Najozbiljniji incident uključivao je agenta koji je napisao zlonamerni kod i kreirao lažne identitete na internetu u pokušaju da ubedi stvarnu osobu da ga odobri. Antropik je kasnije potvrdio da je njegov model bio odgovoran za taj slučaj.
Institut je naveo da nije pronašao dokaze da su incidenti izazvali stvarnu štetu u svetu.
Za razliku od ranijih slučajeva probijanja zaštitnih sistema u kojima su učestvovale obe kompanije, ovi agenti nisu uspeli da izađu iz izolovanog okruženja. Tokom testiranja imali su odobren pristup internetu, ali su delovali van okvira svojih zadataka i stupali u kontakt sa stvarnim spoljnim metama.
Antropik je saopštio da ovaj slučaj pokazuje potrebu za širom raspravom o tome kako bezbedno procenjivati sve sposobnije AI agente. OpenAI je pozvao na uvođenje snažnijih zajedničkih pravila za testiranje sistema visokog rizika.
Ovi nalazi dolaze nakon niza sličnih incidenata koji uključuju napredne AI modele.
Prošlog meseca, jedan OpenAI agent uspeo je da izađe iz svog testnog okruženja i hakovao AI platformu Hjaging Fejs dok je tražio odgovore za test sajber bezbednosti. Kompanija je kasnije priznala da su ugrožena i četiri naloga na četiri odvojene usluge.
Antropik je potom otkrio tri slučaja u kojima su njegovi Klod modeli nenamerno ciljali stvarne organizacije nakon što je testno okruženje greškom ostalo povezano sa internetom. U jednom slučaju, zlonamerni softverski paket koji je napravio model postavljen je u javni repozitorijum i pokrenut na 15 stvarnih sistema.
Ovi incidenti dodatno su pojačali zabrinutost da autonomni AI sistemi postaju sposobni da otkrivaju ranjivosti, pišu hakerske alate i sprovode socijalni inženjering brže nego što istraživači uspevaju da razumeju njihove postupke i razviju neophodne zaštitne mere.
Nulta Tačka/RT