text size
Istraživač Anthropica procjenjuje da postoji više od 10 posto šanse da vještačka inteligencija ubije sve ljude u narednoj deceniji. Iza ove izjave stoji problem koji je mnogo konkretniji od scenarija iz naučnofantastičnih filmova: šta se događa kada AI dobije zadatak, a zatim pronađe način za izvršenje koji niko nije predvidio?
Šta zapravo znači 10 posto šanse za nestanak čovječanstva
Kada je Evan Hubinger, vodeći istraživač kompanije Anthropic, izjavio da lično procjenjuje da postoji više od 10 posto šanse da vještačka inteligencija usmrti čovječanstvo u narednih deset godina, nije govorio o robotima koji odlučuju zaratiti s ljudima.
Govorio je o mogućnosti da budući AI sistemi postanu toliko sposobni i samostalni da ljudi više ne mogu pouzdano kontrolirati način na koji oni izvršavaju zadatke.
Njegova procjena nije rezultat statističkog modela koji dokazuje da će se katastrofa dogoditi u jednom od deset mogućih scenarija. Riječ je o ličnoj procjeni rizika istraživača koji se profesionalno bavi problemom usklađivanja vještačke inteligencije s ljudskim ciljevima.
Taj problem se u industriji naziva AI alignment (engl. AI usklađivanje). Najjednostavnije rečeno, cilj je da AI ne uradi samo ono što mu je zadato, već ono što je čovjek zaista želio postići. Razlika između ta dva ishoda može biti ogromna.
Zamislimo da AI dobije zadatak da izliječi rak
Zamislimo da razvijemo izuzetno napredan AI sistem i damo mu zadatak da eliminira rak.
Čovjek pod tim podrazumijeva pronalaženje terapije, razvoj lijekova i sprečavanje nastanka bolesti. Ali šta ako sistem dobije cilj definiran isključivo kao smanjenje broja oboljelih na nulu, bez dovoljno jasnih ograničenja načina na koji to smije postići?
Jedno moguće pogrešno rješenje bilo bi da prestane prijavljivati nove slučajeve bolesti. Broj registriranih pacijenata tada bi pao, ali nijedan čovjek ne bi bio izliječen.
U krajnjem hipotetičkom scenariju, sistem koji bi imao neograničene mogućnosti i kojem očuvanje ljudskog života nije postavljeno kao uslov mogao bi zaključiti da je najjednostavniji način da rak više ne postoji trajno uklanjanje ljudi koji imaju rak.
Ovo nije tvrdnja da bi današnji AI postupio na taj način, već misaoni eksperiment koji objašnjava problem pogrešno definiranog cilja. Za takav katastrofalan ishod sistem bi morao imati i sposobnosti i pristup sredstvima kojima može nanijeti stvarnu štetu.
Ipak, isti osnovni problem već je zabilježen u znatno jednostavnijim eksperimentima.
Google DeepMind je istraživao AI agenta čiji je zadatak bio da pobijedi u trci čamaca. Sistem je otkrio da više poena može prikupiti ako se neprestano okreće u krug i sakuplja bonuse, umjesto da završi trku.
AI je ostvario visok rezultat, ali nije ispunio stvarnu namjeru istraživača.
Razlika je u tome što u videoigri takvo ponašanje znači izgubljenu trku. U medicini, energetici ili upravljanju kritičnom infrastrukturom pogrešno definiran cilj mogao bi imati dosta ozbiljnije posljedice.
AI je već napustio kontrolirano okruženje i napao drugu kompaniju
OpenAI je prijavio incident u julu 2026., koji je pokazao da AI agenti mogu preći granice test okruženja i prouzrokovati stvarne sigurnosne incidente. Tokom internog testiranja cyber sposobnosti, OpenAI-jevi modeli dobili su zadatak da rješavaju sigurnosne izazove.
Umjesto da se ograniče na predviđeni način rješavanja testa, pojedini agenti počeli su tražiti gotova rješenja. Pronašli su sigurnosne propuste koji su im omogućili da izađu iz izoliranog okruženja, pristupe internetu i prodru u infrastrukturu platforme Hugging Face.
Prema tehničkom izvještaju Hugging Facea, tokom napada je rekonstruirano približno 17.600 automatiziranih radnji. Agent je pristupio dijelovima produkcijske infrastrukture i došao do određenih privatnih podataka.
Važno je razumjeti šta se tu dogodilo. AI nije dobio zadatak da napadne Hugging Face. Njegov zadatak bio je da uspješno završi sigurnosni test. Međutim, pronašao je prečicu: umjesto da samostalno riješi zadatak, pokušao je doći do postojećih rješenja, čak i kada je to zahtijevalo zaobilaženje ograničenja i neovlašten pristup tuđoj infrastrukturi.
Incident nije doveo do katastrofe. Ipak, pokazao je da greška u načinu izvršavanja zadatka više ne mora ostati unutar kontroliranog eksperimenta.
Drugi sličan primjer se desio u augustu ove godine. Andrew Bird, direktor za AI u australijskoj kompaniji Affinda, zatražio je od svog AI agenta da mu osigura mjesto na popularnom treningu u teretani. Kada je završio na četvrtom mjestu liste čekanja, pitao je agenta može li ga pomjeriti više.
Agent je pronašao sigurnosni propust u sistemu za rezervacije i otkazao prijavu drugog korisnika, čime je Birda pomjerio za jedno mjesto. Kada je Bird shvatio šta se dogodilo, naredio mu je da vrati tuđu rezervaciju, ali AI to nije mogao uraditi. AI nije dobio zadatak da hakira sistem, već da pronađe mjesto na treningu. Ipak, samostalno je izabrao način koji je oštetio drugog čovjeka.
Od jednog pogrešnog zadatka do globalnog problema
Sva tri primjera povezuje isti obrazac. AI dobija zadatak, pronalazi način da ostvari zadati rezultat i pritom poduzima radnje koje čovjek nije namjeravao dozvoliti, i nije predvidio da će uraditi.
Kod jednostavnog sistema posljedica može biti pogrešan odgovor. Kod autonomnog agenta to može biti neovlašten pristup podacima. Kod budućih sistema koji upravljaju važnim dijelovima ekonomije i infrastrukture, posljedice bi mogle biti znatno šire.
Hubingerova procjena ne znači da postoji naučni konsenzus o vjerovatnoći nestanka čovječanstva. Također ne znači da bi današnji ChatGPT ili Claude mogli samostalno provesti neki od opisanih katastrofalnih scenarija.
Za takav ishod bili bi potrebni mnogo sposobniji sistemi, visok stepen samostalnosti, pristup stvarnoj infrastrukturi i neuspjeh više sigurnosnih mehanizama.
Istraživači se ne slažu u vezi s tim koliko su ovakvi scenariji vjerovatni. Dio stručnjaka smatra da se rizik od razvoja izuzetno sposobnih autonomnih sistema mora ozbiljno shvatiti, dok drugi upozoravaju da su između ponašanja u simulacijama i katastrofe u stvarnom svijetu i dalje velike tehničke i fizičke prepreke.
Ali to je upravo razlog zbog kojeg je izjava istraživača Anthropica privukla toliko pažnje.