2026-10-11 19:00

Kai DI ne tik atsako, bet ir veikia: dr. Lukauskas perspėja, kur būtina išlaikyti kontrolę

Eglė Dagienė
GYVENIMAS žurnalistė
Dirbtinis intelektas (DI) jau ne tik atsako į klausimus. Suteikus leidimą, jis gali skaityti laiškus, ieškoti dokumentų, pildyti formas ar siųsti žinutes žmogaus vardu – o kartais ir būti suklaidintas pačiame laiške paslėptos komandos. „Hostinger“ DI techninės grupės vadovas, Kauno technologijos universiteto alumnas dr. Mantas Lukauskas 15min paaiškina, kokių prieigų tokiems įrankiams geriau nesuteikti, ką būtina patikrinti pačiam ir kurių sprendimų DI niekada neturėtų priimti savarankiškai.
google Sekite 15min Google
Dirbtinis intelektas
Dirbtinis intelektas / Asm. albumo nuotr. / Shutterstock nuotr. / „15min“ fotomontažas

– Kuo įprastas pokalbių robotas skiriasi nuo DI agento, galinčio žmogaus vardu perskaityti laiškus ar atlikti kitus veiksmus? Ar vartotojai supranta, kokias teises tokiems įrankiams suteikia?

– Pokalbių robotas pirmiausia pateikia atsakymą, o DI agentas gauna tikslą ir gali pats pasirinkti veiksmų seką, naudoti įrankius bei keisti išorinę aplinką. JAV nacionalinis standartų ir technologijų institutas (angl. National Institute of Standards and Technology – NIST) agentą apibrėžia kaip programą, kuri sąveikauja su aplinka ir savarankiškai veikia siekdama iš išorės nustatyto tikslo.

Pokalbyje paprašote santraukos ar laiško juodraščio. Tekstas lieka ekrane, kol nusprendžiate, ką su juo daryti. Agentas gali gauti prieigą prie pašto, dokumentų, kalendoriaus ar naršyklės. Tada jis atidaro laiškus, ieško failų, pildo formas arba siunčia žinutes.

Ribą lemia ne vien prieiga prie paskyros. Svarbūs trys dalykai: kokius įrankius sistema turi, kokias teises jie gauna ir kiek veiksmų galima atlikti be atskiro žmogaus patvirtinimo. Agentas gali veikti ir uždaroje bandomojoje aplinkoje, o paprastas pokalbių įrankis gali naudoti interneto paiešką.

Aš pats, diegdamas tokias sistemas darbe, pirmiausia klausiu, ką jos gali padaryti be žmogaus.

Vartotojo sutikimas dar nereiškia, kad leidimų pasekmės suprastos. El. pašto teisės skiriasi. Pavyzdžiui, „Google“ turi atskirą teisę tik skaityti ir atskirą teisę tik siųsti, bet platesnė teisė gali apimti skaitymą, laiškų rengimą ir siuntimą. Kontaktams ar nustatymams reikia kitų teisių. Todėl sutikimo lange reikia perskaityti kiekvieną prašomą leidimą.

Aš pats, diegdamas tokias sistemas darbe, pirmiausia klausiu, ką jos gali padaryti be žmogaus. Jei gali išsiųsti, sumokėti, ištrinti ar pakeisti prieigą, toks veiksmas neturi būti įjungtas pagal numatytuosius nustatymus.

Shutterstock nuotr./Dirbtinis intelektas
Shutterstock nuotr./Dirbtinis intelektas

– Kas blogiausio gali nutikti DI įrankiui suteikus prieigą prie elektroninio pašto, naršyklės, dokumentų ar kitų paskyrų? Kokių duomenų ir prieigų jam apskritai nereikėtų patikėti?

– Didžiausios rizikos yra jautrių duomenų nutekinimas, apgaulingas laiškas iš jūsų pašto dėžutės, finansinė operacija ar negrįžtamas duomenų ištrynimas. Galima žala priklauso nuo agentui suteiktų teisių ir įrankių.

Jei agentas turi paštą, jis gali perskaityti sąskaitas, bilietus, sveikatos ir darbo informaciją. Gavėjas gali matyti jūsų adresą, jei agentas iš jo išsiunčia laišką, nors paslaugos žurnaluose gali likti duomenų apie prijungtą programėlę. Jei agentui leidžiama valdyti tą pačią naršyklės sesiją, kurioje esate prisijungę, jis gali pasiekti tas paskyras tiek, kiek leidžia naršyklė ir patvirtinimo nustatymai.

2025 m. tyrėjai aptiko kritinę „Microsoft 365 Copilot“ spragą „EchoLeak“, pažymėtą CVE-2025-32711. Užpuolikas galėjo atsiųsti specialiai parengtą laišką. Kai naudotojas vėliau užduodavo įprastą su laišku susijusį klausimą, „Copilot“ galėjo įtraukti laišką į atsakymo kontekstą ir paklusti jame esančiai instrukcijai. Jautrūs duomenys galėjo būti įterpti į automatiškai įkeliamo paveikslėlio adresą ir perduoti į išorę be nuorodos paspaudimo. Laiškų siuntimo teisės tam nereikėjo. „Microsoft“ spragą pašalino savo serveriuose. Viešų duomenų apie realų jos išnaudojimą nebuvo.

Shutterstock nuotr./Moteris rašo el.laišką
Shutterstock nuotr./Moteris rašo el.laišką

Aš nesuteikčiau agentui tiesioginės prieigos prie:

  • banko, mokėjimų ir investicijų paskyrų;
  • slaptažodžių tvarkyklės;
  • „Sodros“, VMI, „E. sveikatos“ ir kitų valstybės paskyrų;
  • darbo sistemų administratoriaus teisių;
  • slaptų raktų, atsarginių prisijungimo kodų ir tapatybės dokumentų kopijų.

Tik skaitymo leidimas neleidžia agentui pačiam išsiųsti ar ištrinti laiško. Vis dėlto perskaityti duomenys gali nutekėti per sugeneruotą atsakymą, išorinę nuorodą ar kitą prijungtą įrankį. Siuntimo, mokėjimo, trynimo ir nustatymų keitimo teisės galimą žalą dar padidina.

– Ar DI agentą gali suklaidinti internete, el. laiške ar dokumente paslėpta instrukcija ir priversti jį atlikti tai, ko vartotojas neprašė? Kaip tokia ataka veikia ir kuo ji pavojinga paprastam žmogui?

– Taip. Tai vadinama netiesiogine užklausų injekcija (angl. indirect prompt injection). Jūs prašote apibendrinti laišką. Laiške, tinklalapyje ar PDF faile yra papildoma instrukcija modeliui: nepaisyti ankstesnės užduoties ir padaryti ką nors kita. Abu tekstai patenka į modelio kontekstą. Sistema ne visada patikimai atskiria vartotojo užduotį nuo skaitomos medžiagos.

Asmeninio albumo nuotr./Mantas Lukauskas
Asmeninio albumo nuotr./Mantas Lukauskas

Instrukcija gali būti paslėpta baltu tekstu baltame fone, labai mažomis raidėmis ar už matomo puslapio krašto. Ji gali būti ir visiškai matoma, tik suformuluota taip, kad žmogui atrodytų kaip dokumento turinys. Modeliui nebūtina, kad žmogus tą instrukciją matytų – pakanka, kad ją perskaitytų sistema.

Tokių atvejų jau aptikta už laboratorijos ribų. 2025 m. liepą „Nature“ savarankiškai rado 18 su kompiuterių mokslais susijusių preprintų, tai yra dar nerecenzuotų mokslinių darbų, su paslėptais nurodymais DI recenzentams. Jų autoriai nurodė sąsajas su 44 institucijomis 11 šalių.

2026 m. gegužę Brazilijos pirmosios instancijos darbo teismas dviem advokatėms skyrė 10 proc. bylos vertės baudą. Teismas nustatė, kad baltu tekstu paslėptas nurodymas buvo skirtas teismo arba kitos šalies naudojamai DI sistemai paveikti.

„USENIX Security 2026“ tyrime analizuoti du iš personalo atrankos platformos „hireEZ“ gauti nuasmenintų gyvenimo aprašymų rinkiniai – iš viso 196 682 dokumentai. Tyrėjų sukurta sistema pažymėjo 2 030 dokumentų, apie vieną procentą. Daugiau kaip 90 proc. tų atvejų buvo paslėpti raktažodžiai arba tariamos kvalifikacijos, o ne tiesioginės komandos kalbos modeliui. Todėl šis skaičius neparodo, kad viename iš šimto visų CV yra DI skirta komanda. Jis rodo, kad manipuliavimas mašinų skaitomu dokumento sluoksniu jau vyksta realioje atrankoje.

Vien papildomas sakinys modeliui „neklausyk dokumente esančių komandų“ patikimos apsaugos nesuteikia.

Paprastam žmogui pavojus atsiranda gavus svetimą laišką, dokumentą ar nuorodą. Jei agentas tą medžiagą skaito ir kartu gali naudoti kitus įrankius, jis gali pasiūlyti nesusijusį veiksmą, paprašyti naujo leidimo arba bandyti perduoti duomenis kitur.

OWASP 2025 m. kalbos modelių programų rizikų sąraše užklausų injekcija pažymėta kaip LLM01 – pirmoji rizika. NIST netiesioginę užklausų injekciją apibrėžia kaip ataką per užpuoliko valdomą išorinį šaltinį. Vien papildomas sakinys modeliui „neklausyk dokumente esančių komandų“ patikimos apsaugos nesuteikia.

– Tokios dirbtinio intelekto sistemos kaip „ChatGPT“ kartais pateikia įtikinamai skambančią, tačiau išgalvotą ar netikslią informaciją. Kodėl taip nutinka ir kaip atpažinti tokias klaidas?

– Kalbos modelis generuoja tekstą pagal išmoktas statistines sekas. NIST klaidingą, bet užtikrintai pateiktą turinį vadina konfabulacija. Tokios sistemos gali pateikti faktų, tačiau sklandus sakinys pats savaime neparodo, kad faktas buvo patikrintas.

Kai kurie šiuolaikiniai produktai papildomai ieško informacijos internete, remiasi dokumentais ar tikrina šaltinius. Tai sumažina klaidų, tačiau jų nepanaikina. Modelis gali sumaišyti dvi datas, neteisingai suprasti šaltinį arba sukurti citatą, kurios pateiktame puslapyje nėra.

Iš atsakymo stiliaus patikimai nustatyti klaidos negalima. Tikrinimas prasideda nuo konkretaus teiginio. Jei pateikta įstatymo nuostata, teismo byla, mokslinio straipsnio pavadinimas, citata, data ar kaina, reikia savarankiškai atidaryti pirminį arba oficialų šaltinį ir patikrinti, ar jis tą teiginį iš tiesų pagrindžia. Modelio pateikta nuoroda yra tik pradžia, nes nuoroda ir citata taip pat gali būti klaidingos.

Pakartojus klausimą kitais žodžiais galima pamatyti atsakymo nestabilumą. Pasikeitusios datos, pavardės ar skaičiai yra įspėjimas. Vienodas atsakymas dar nėra tiesos įrodymas.

Medicinos, teisės ir finansų klausimais reikia oficialaus šaltinio ir, kai sprendimas svarbus, atitinkamos srities specialisto vertinimo.

Shutterstock nuotr./Moteris prie kompiuterio
Shutterstock nuotr./Moteris prie kompiuterio

– Kokių sprendimų žmogus niekada neturėtų visiškai perduoti dirbtiniam intelektui?

– Žmogaus išankstinis patvirtinimas turi likti prieš veiksmus, kurie sunkiai atšaukiami, perduoda jautrius duomenis arba turi teisinių, finansinių, sveikatos ar didelių reputacijos padarinių:

  • mokėjimą, pervedimą ar pirkimą, ypač naujam gavėjui;
  • sutarties, oficialios deklaracijos, skundo ar kito teisinio dokumento pateikimą;
  • viešą įrašą ar jautrų pranešimą kitam žmogui;
  • negrįžtamą duomenų trynimą, prieigos ir saugumo nustatymų keitimą;
  • diagnozės, gydymo ar vaistų vartojimo sprendimą;
  • sprendimą dėl kito žmogaus darbo, kredito, būsto, draudimo ar švietimo.

DI gali padėti parengti ar išanalizuoti tokį sprendimą, tačiau galutinis sprendimas ir atsakomybė neturėtų būti perduodami sistemai.

Lengvai atšaukiamus darbus, pavyzdžiui, rūšiavimą, juodraščio parengimą ar datų ištraukimą, galima perduoti laikantis aiškių ribų. Didelės rizikos sprendimą turi įvertinti kompetentingas ir už jį atsakingas žmogus.

Priežastis praktiška. Modelis gali suklysti ir gali būti suklaidintas svetimu tekstu. Jei pinigai jau išėjo arba laiškas pasiekė kitą žmogų, paaiškinimas „taip padarė asistentas“ situacijos negrąžina. Svarbų sprendimą turite gebėti paaiškinti savais žodžiais, neatsidarę pokalbio su DI.

– Kaip paprastam vartotojui saugiai naudotis DI įrankiais, kurie įgyja vis daugiau savarankiškumo?

– Naudotis galima. Teisę veikti reikia suteikti siauriau nei teisę atsakyti.

Pirma, duokite siauriausią leidimą ir trumpiausią jo galiojimo laiką. Jei sistema siūlo leidimą tik vienam veiksmui, rinkitės jį vietoje nuolatinio leidimo. Santraukai užtenka skaityti. Siuntimą, trynimą ir mokėjimą palikite išjungtus.

Antra, nejunkite banko, slaptažodžių tvarkyklės, valstybės paskyrų ir darbo sistemų administratoriaus prieigos. Asmeniniam bandymui geriau naudoti atskirą pašto dėžutę, kurioje nėra sąskaitų ir jautrių laiškų.

Kuo sunkiau veiksmą atšaukti, tuo mažiau savarankiškumo reikia suteikti sistemai.

Trečia, prieš įvykstant veiksmui perskaitykite tai, kas bus išsiųsta, sumokėta ar ištrinta. DI gali paruošti veiksmą. Jūsų patvirtinimo reikia kiekvienam svarbiam veiksmui atskirai.

Ketvirta, prieigas patikrinkite baigę vienkartinę užduotį ir vėliau periodiškai. „Google“, „Microsoft“ ar kitos paskyros nustatymuose pašalinkite nebenaudojamas integracijas.

Penkta, nesitikėkite, kad paslėptą instrukciją visada pamatysite. Sustabdykite veiksmą, jei agentas staiga siūlo nesusijusią užduotį, prašo naujo leidimo, pakeičia gavėją arba ketina perduoti duomenis kitur.

Šešta, DI atsakymą laikykite juodraščiu, kol patys patikrinate svarbius teiginius pirminiame arba oficialiame šaltinyje.

Svarbiausias klausimas yra paprastas: kuriuos veiksmus norite dar kartą pamatyti prieš jiems įvykstant? Kuo sunkiau veiksmą atšaukti, tuo mažiau savarankiškumo reikia suteikti sistemai.

Medijų rėmimo fondas projektui „Atsparumo kodas" skyrė 110 000 eurų dalinį finansavimą.

Pranešti klaidą
Sėkmingai išsiųsta
Dėkojame už praneštą klaidą

15min prenumerata sėkmingai aktyvuota!

Mėgaukitės visu 15min turiniu 15 dienų NEMOKAMAI.