text size
Istraživač Anthropica procjenjuje da postoji više od 10 odsto šanse da vještačka inteligencija ubije sve ljude u narednoj deceniji. Iza ove izjave stoji problem koji je mnogo konkretniji od scenarija iz naučnofantastičnih filmova: šta se događa kada AI dobije zadatak, a zatim pronađe način da ga izvrši koji niko nije predvidio?
Šta zapravo znači 10 odsto šanse za nestanak čovječanstva
Kada je Evan Hubinger, vodeći istraživač kompanije Anthropic, izjavio da lično procjenjuje da postoji više od 10 odsto šanse da vještačka inteligencija usmrti čovječanstvo u narednih deset godina, nije govorio o robotima koji odlučuju da zarate sa ljudima.
Govorio je o mogućnosti da budući AI sistemi postanu toliko sposobni i samostalni da ljudi više ne mogu pouzdano da kontrolišu način na koji oni izvršavaju zadatke.
Njegova procjena nije rezultat statističkog modela koji dokazuje da će se katastrofa dogoditi u jednom od deset mogućih scenarija. Riječ je o ličnoj procjeni rizika istraživača koji se profesionalno bavi problemom usklađivanja vještačke inteligencije sa ljudskim ciljevima.
Taj problem se u industriji naziva AI alignment (engl. AI usklađivanje). Najjednostavnije rečeno, cilj je da AI ne uradi samo ono što mu je zadato, već ono što je čovjek zaista želio da postigne. Razlika između ta dva ishoda može biti ogromna.
Zamislimo da AI dobije zadatak da izliječi rak
Zamislimo da razvijemo izuzetno napredan AI sistem i damo mu zadatak da eliminiše rak.
Čovjek pod tim podrazumijeva pronalaženje terapije, razvoj lijekova i sprječavanje nastanka bolesti. Ali šta ako sistem dobije cilj definisan isključivo kao smanjenje broja oboljelih na nulu, bez dovoljno jasnih ograničenja načina na koji to smije da postigne?
Jedno moguće pogrešno riješenje bilo bi da prestane da prijavljuje nove slučajeve bolesti. Broj registrovanih pacijenata tada bi pao, ali nijedan čovjek ne bi bio izliječen.
U krajnjem hipotetičkom scenariju, sistem koji bi imao neograničene mogućnosti i kojem očuvanje ljudskog života nije postavljeno kao uslov mogao bi da zaključi da je najjednostavniji način da rak više ne postoji trajno uklanjanje ljudi koji imaju rak.
Ovo nije tvrdnja da bi današnji AI postupio na taj način, već misaoni eksperiment koji objašnjava problem pogrešno definisanog cilja. Za takav katastrofalan ishod sistem bi morao da ima i sposobnosti i pristup sredstvima kojima može da nanese stvarnu štetu.
Ipak, isti osnovni problem već je zabilježen u znatno jednostavnijim eksperimentima.
Google DeepMind je istraživao AI agenta čiji je zadatak bio da pobijedi u trci čamaca. Sistem je otkrio da više poena može da prikupi ako se neprestano okreće u krug i sakuplja bonuse, umjesto da završi trku.
AI je ostvario visok rezultat, ali nije ispunio stvarnu namjeru istraživača.
Razlika je u tome što u video-igri takvo ponašanje znači izgubljenu trku. U medicini, energetici ili upravljanju kritičnom infrastrukturom pogrešno definisan cilj mogao bi da ima daleko ozbiljnije posljedice.
AI je već napustio kontrolisano okruženje i napao drugu kompaniju
OpenAI je prijavio incident u julu 2026. koji je pokazao je da AI agenti mogu da pređu granice test okruženja i prouzrokuju stvarne bezbjednosne incidente. Tokom internog testiranja cyber sposobnosti, OpenAI-jevi modeli dobili su zadatak da rješavaju bezbjednosne izazove.
Umjesto da se ograniče na predviđeni način riješavanja testa, pojedini agenti počeli su da traže gotova riješenja. Pronašli su bezbjednosne propuste koji su im omogućili da izađu iz izolovanog okruženja, pristupe internetu i prodru u infrastrukturu platforme Hugging Face.
Prema tehničkom izjveštaju Hugging Facea, tokom napada rekonstruisano je približno 17.600 automatizovanih radnji. Agent je pristupio dijelovima produkcione infrastrukture i došao do određenih privatnih podataka.
Važno je razumjeti šta se tu dogodilo. AI nije dobio zadatak da napadne Hugging Face. Njegov zadatak bio je da uspješno završi bezbjednosni test. Međutim, pronašao je prečicu: umjesto da samostalno riješi zadatak, pokušao je da dođe do postojećih riješenja, čak i kada je to zahtjevalo zaobilaženje ograničenja i neovlaten pristup tuđoj infrastrukturi.
Incident nije doveo do katastrofe. Ipak, pokazao je da greška u načinu izvršavanja zadatka više ne mora da ostane unutar kontrolisanog eksperimenta.
Drugi sličan primjer se desio u avgustu ove godine. Andrew Bird, direktor za AI u australijskoj kompaniji Affinda, zatražio je od svog AI agenta da mu obezbijedi mjesto na popularnom treningu u teretani. Kada je završio na četvrtom mjestu liste čekanja, pitao je agenta može li da ga pomjeri više.
Agent je pronašao bezbjednosni propust u sistemu za rezervacije i otkazao prijavu drugog korisnika, čime je Birda pomjerio za jedno mjesto. Kada je Bird shvatio šta se dogodilo, naredio mu je da vrati tuđu rezervaciju, ali AI to nije mogao da uradi. AI nije dobio zadatak da hakuje sistem, već da pronađe mjesto na treningu. Ipak, samostalno je izabrao način koji je oštetio drugog čovjeka.
Od jednog pogrešnog zadatka do globalnog problema
Sva tri primjera povezuje isti obrazac. AI dobija zadatak, pronalazi način da ostvari zadati rezultat i pritom preduzima radnje koje čovjek nije namjeravao da dozvoli, i nije predvidio da će uraditi.
Kod jednostavnog sistema posljedica može da bude pogrešan odgovor. Kod autonomnog agenta to može da bude neovlaten pristup podacima. Kod budućih sistema koji upravljaju važnim dijelovima ekonomije i infrastrukture, posljedice bi mogle da budu znatno šire.
Hubingerova procjena ne znači da postoji naučni konsenzus o vjerovatnoći nestanka čovječanstva. Takođe ne znači da bi današnji ChatGPT ili Claude mogli samostalno da sprovedu neki od opisanih katastrofalnih scenarija.
Za takav ishod bili bi potrebni mnogo sposobniji sistemi, visok stepen samostalnosti, pristup stvarnoj infrastrukturi i neuspjeh više bezbjednosnih mehanizama.
Istraživači se ne slažu oko toga koliko su ovakvi scenariji vjerovatni. Dio stručnjaka smatra da se rizik od razvoja izuzetno sposobnih autonomnih sistema mora ozbiljno shvatiti, dok drugi upozoravaju da su između ponašanja u simulacijama i katastrofe u stvarnom svijetu i dalje velike tehničke i fizičke prepreke.
Ali to je upravo razlog zbog kojeg je izjava istraživača Anthropica privukla toliko pažnje.