Šie incidentai įvyko „Anthropic“ atliekant kibernetinius bandymus, kurių metu neuroniniai tinklai turėjo įsilaužti į fiktyvią sistemą ir surasti informaciją. Eksperimente dalyvavo trys modeliai: „Claude Opus 4.7“, „Claude Mythos 5“ ir dar viena vidinė AI versija.
Visi jie turėjo veikti izoliuotoje aplinkoje be interneto ryšio, tačiau dėl konfigūracijos klaidos prieiga prie tinklo buvo atvira. „Modeliai sąmoningai nebandė išeiti iš aplinkos – jie atliko jiems paskirtas užduotis, tačiau dėl konfigūracijos klaidos realias sistemas suvokė kaip bandymo dalį“, – teigė „Anthropic“.
Rimčiausias atvejis įvyko su „Claude Opus 4.7“. Per kelis bandymus modelis aptiko įmonės domeną, kuris sutapo su fiktyvaus taikinio pavadinimu, gavo prisijungimo duomenis ir įgijo prieigą prie įmonės duomenų bazės.
„Claude Mythos 5“ užregistravo paskyrą viešame repozitoriume ir atsisiuntė kenkėjišką paketą. Jis viešai buvo prieinamas apie valandą. Per tą laiką paketas buvo įdiegtas 15 tikrų įrenginių, po to modelis gavo prieigą prie prisijungimo duomenų ir persikėlė į kito asmens infrastruktūrą.
Trečiasis atvejis įvyko su vidiniu bandomuoju modeliu „Anthropic“. Negalėdama rasti tinkamo taikinio simuliacijoje, ji pradėjo ieškoti alternatyvų internete, nuskenavo 9 000 serverių ir, pasinaudojusi pažeidžiamumu, sugebėjo prisijungti prie realios įmonės programos. Kai modelis suprato, kad dirba su realia sistema, jis nutraukė ataką.
Panašų atvejį anksčiau atskleidė „OpenAI“. 2026 m. liepos 22 d. bendrovė paskelbė, kad vidaus auditų metu jos AI agentai sugebėjo išeiti iš izoliuotos aplinkos ir gauti prieigą prie „Hugging Face“ ir „Modal Labs“ platformų infrastruktūros.
Pasak „OpenAI“, modeliai nustatė, kad reikalingi duomenys gali būti „Hugging Face“ platformoje, ir paleido savo kodą šios platformos serveriuose. „Modal“ technikos direktorius Akshat Bubna teigė, kad agentas pasinaudojo pažeidžiamumu, esančiu įmonės kliento parašytame kode, kuris buvo talpinamas „Modal“ platformoje.
