Eksperimentą atlikęs inžinierius, socialiniame tinkle X naudojantis „DrivingBench“ vardu, išbandė kelis DI modelius, suteikdamas jiems galimybę valdyti tikrą „Toyota Corolla“. Eksperimentas vyko tuščioje automobilių stovėjimo aikštelėje.
Bandymuose dalyvavo dvi skirtingos „ChatGPT“ versijos, taip pat „Claude“ ir „Grok“. Visi modeliai susidūrė su įvairiomis problemomis, tačiau vienas iš jų pasirodė geriau už kitus.
DI tiesiogiai valdė automobilio sistemas
Inžinierius DI modelius tiesiogiai prijungė prie automobilio vairo, akceleratoriaus ir stabdžių valdymo sistemų.
Kadangi įprasti DI modeliai nėra sukurti aplinkai realiuoju laiku stebėti ir sprendimams dėl stabdymo priimti per sekundės dalis, buvo sukurta speciali sistema. Automobilio kameros fiksavo aplinką, o vaizdinė informacija buvo perduodama DI modeliui kaip užklausos kontekstas.
Modeliai savo ruožtu pateikdavo tekstines komandas: kiek pasukti vairą, kiek procentų nuspausti akceleratorių ir kokia jėga stabdyti.
Tačiau netrukus išryškėjo pagrindinė problema – DI modeliai sprendimus priimdavo per lėtai.
Pavyzdžiui, tuo metu, kai modeliui reikėdavo nurodyti vairą pasukti 15 laipsnių, automobilis jau būdavo gerokai nukrypęs nuo numatytos trajektorijos.
Dar viena rimta problema – ribotas erdvinis suvokimas. Modeliams buvo sunku tiksliai įvertinti atstumą iki kliūčių ir suprasti trimatę aplinką.
Kartais DI pateikdavo net prieštaringas komandas. Eksperimento metu buvo atvejų, kai sistema vienu metu nurodė perduoti varikliui 100 proc. galios ir kartu visiškai stabdyti automobilį.
Kuris DI pasirodė geriausiai?
Pasak eksperimente dalyvavusio inžinieriaus, geriausiai pasirodė naujausias GPT-6 Astra modelis. Vis dėlto net ir jis nesugebėjo pakankamai greitai reaguoti į besikeičiančią situaciją.
Grok reagavo gerokai greičiau, tačiau, inžinieriaus vertinimu, jo sprendimams trūko tikslumo ir saugumo.
Claude buvo panašus į „ChatGPT“ – gana gerai atpažino galimus pavojus, tačiau veikė pernelyg atsargiai ir neryžtingai.
Eksperimento autoriaus vertinimu, pirmąją vietą užėmė GPT-6 Astra. Pirmasis bandymas šiam modeliui nepavyko, tačiau antrojo bandymo metu jis maršrutą įveikė per 5 minutes ir 22 sekundes, panaudodamas ankstesnio bandymo metu padarytas klaidas.
Antrąją vietą, pagal inžinieriaus atliktą eksperimentą, užėmė Claude Fable 5.1, įveikęs apie 45 proc. maršruto.
Grok 4.6 iš bandymo pasitraukė įveikęs apie 11 proc. maršruto, o GPT-5.6 Sol – vos apie 6 proc.
Šis eksperimentas nėra oficialus automobilių autonominio vairavimo sistemų bandymas, tačiau jis parodo vieną svarbią problemą: nors šiuolaikiniai DI modeliai puikiai analizuoja informaciją ir priima sudėtingus sprendimus, vairuojant tikrą automobilį neužtenka vien suprasti vaizdą – būtina reaguoti itin greitai, tiksliai suvokti erdvę ir patikimai koordinuoti daugybę veiksmų vienu metu.
