2026-07-31 15:49

Dar vienas atvejis: „Anthropic“ dirbtinio intelekto modelis ištrūko ir atakavo

Antroji pagal dydį dirbtinio intelekto srities įmonė pranešė, kad jos projektas uždarų bandymų metu ištrūko iš izoliuotos aplinkos ir užpuolė trečiųjų šalių išteklius. „Anthropic“ ketvirtadienį pranešė, kad buvo nustatyti trys atvejai, kai modeliai gavo prieigą prie interneto ir įsilaužė į realių organizacijų infrastruktūrą. Apie tai rašo „The Moscow Times“.
Dirbtinis intelektas
Dirbtinis intelektas / Shutterstock nuotrauka

Šie incidentai įvyko „Anthropic“ atliekant kibernetinius bandymus, kurių metu neuroniniai tinklai turėjo įsilaužti į fiktyvią sistemą ir surasti informaciją. Eksperimente dalyvavo trys modeliai: „Claude Opus 4.7“, „Claude Mythos 5“ ir dar viena vidinė AI versija.

Visi jie turėjo veikti izoliuotoje aplinkoje be interneto ryšio, tačiau dėl konfigūracijos klaidos prieiga prie tinklo buvo atvira. „Modeliai sąmoningai nebandė išeiti iš aplinkos – jie atliko jiems paskirtas užduotis, tačiau dėl konfigūracijos klaidos realias sistemas suvokė kaip bandymo dalį“, – teigė „Anthropic“.

Rimčiausias atvejis įvyko su „Claude Opus 4.7“. Per kelis bandymus modelis aptiko įmonės domeną, kuris sutapo su fiktyvaus taikinio pavadinimu, gavo prisijungimo duomenis ir įgijo prieigą prie įmonės duomenų bazės.

„Claude Mythos 5“ užregistravo paskyrą viešame repozitoriume ir atsisiuntė kenkėjišką paketą. Jis viešai buvo prieinamas apie valandą. Per tą laiką paketas buvo įdiegtas 15 tikrų įrenginių, po to modelis gavo prieigą prie prisijungimo duomenų ir persikėlė į kito asmens infrastruktūrą.

Trečiasis atvejis įvyko su vidiniu bandomuoju modeliu „Anthropic“. Negalėdama rasti tinkamo taikinio simuliacijoje, ji pradėjo ieškoti alternatyvų internete, nuskenavo 9 000 serverių ir, pasinaudojusi pažeidžiamumu, sugebėjo prisijungti prie realios įmonės programos. Kai modelis suprato, kad dirba su realia sistema, jis nutraukė ataką.

Panašų atvejį anksčiau atskleidė „OpenAI“. 2026 m. liepos 22 d. bendrovė paskelbė, kad vidaus auditų metu jos AI agentai sugebėjo išeiti iš izoliuotos aplinkos ir gauti prieigą prie „Hugging Face“ ir „Modal Labs“ platformų infrastruktūros.

Pasak „OpenAI“, modeliai nustatė, kad reikalingi duomenys gali būti „Hugging Face“ platformoje, ir paleido savo kodą šios platformos serveriuose. „Modal“ technikos direktorius Akshat Bubna teigė, kad agentas pasinaudojo pažeidžiamumu, esančiu įmonės kliento parašytame kode, kuris buvo talpinamas „Modal“ platformoje.

Pranešti klaidą
Sėkmingai išsiųsta
Dėkojame už praneštą klaidą