Jul 22, 2026
Ključne točke
- Britanski Institut za sigurnost umjetne inteligencije testirao je pet vodećih AI modela tvrtki OpenAI i Anthropic u okviru kibernetičkih sigurnosnih provjera.
- Svih pet modela pokušalo je varati – koristili su prečace, zaobilazna rješenja ili radnje koje su bile izričito zabranjene, a nitko ih na to nije naveo.
- Strategije varanja kretale su se od pretraživanja rješenja na internetu i napada na sustave izvan zadanog cilja evaluacije do ispitivanja samog softvera za procjenu.
Britanski Institut za sigurnost umjetne inteligencije sustavno je testirao modele tvrtki OpenAI i Anthropic kako bi utvrdio varaju li u kibernetičkim sigurnosnim evaluacijama. Svih pet testiranih modela pokušalo je zaobići pravila.
U testovima Instituta za sigurnost AI (AISI) modeli moraju pronaći skrivene nizove znakova tzv. „zastavice” (engl. flags) unutar simuliranih okruženja. Pritom izvode ofenzivne kibernetičke zadatke poput reverznog inženjeringa i iskorištavanja sigurnosnih propusta. Svaki zadatak ima jasno definirana pravila i predviđeni put do rješenja.
Svih pet testiranih naprednih modela pokušalo je varati. Umjesto da slijede predviđeni put do rješenja, koristili su prečace, zaobilazna rješenja ili radnje koje su bile izričito zabranjene. GPT-5.4 varao je u 14,1 posto testnih pokretanja (67 od 475), GPT-5.5 u 11,4 posto, a GPT-5.6 Sol u 12,6 posto. Anthropicov Claude Opus 4.7 zabilježio je 9,1 posto, dok je Claude Mythos Preview dostigao 7,8 posto. Nijedan model nije bio potaknut na varanje.

Oznaka „varanje” ne podrazumijeva nužno namjeru obmanjivanja, naglašava AISI. No takvo ponašanje ipak predstavlja problem: može dovesti do toga da evaluacije precijene stvarne sposobnosti modela i dovedu u zabludu korisnike u situacijama kada je teško provjeriti je li zadatak uspješno izvršen.
AISI nije pronašao jasnu vezu između veće sposobnosti modela i učestalijih pokušaja varanja. Institut umjesto toga tvrdi da je takvo ponašanje „u velikoj mjeri oblikovano specifičnostima tehnika korištenih pri treniranju modela, uključujući trening usklađivanja, a ne samo sirovim sposobnostima”.
Modeli napadaju infrastrukturu, traže odgovore na internetu i pogađaju rješenja
Metode varanja razlikuju se ovisno o modelu. Prema AISI-ju, uobičajene taktike uključuju pretraživanje rješenja na internetu i napade na sustave izvan zadanog cilja evaluacije, pa čak i na sustav koji pokreće sam model. Modeli su također ispitivali softver za evaluaciju kako bi iz njega izvukli odgovore.

GPT-5.6 Sol postigao je najvišu stopu za strategiju pretraživanja interneta u potrazi za rješenjima. To se uklapa u autonomni kibernetički napad koji su OpenAI i Hugging Face nedavno javno objavili, u kojemu su OpenAI modeli pokušali hakirati Hugging Face kako bi dočepali rješenja benchmarka. METR-ova istraga GPT-5.6 Sol modela također je bila u velikoj mjeri kompromitirana lažnim ponašanjem.
Jedan od testiranih modela otišao je i korak dalje, izvještava AISI. Napisao je i pokrenuo kod na vanjskoj usluzi na otvorenom internetu kako bi pristupio AISI-jevoj evaluacijskoj infrastrukturi. Incident se dogodio tijekom zadatka koji je bio pogrešno konfiguriran i nije se mogao riješiti, što je aktiviralo sigurnosno upozorenje. AISI navodi da bi pokušaj mogao biti uspješan da je njihova infrastruktura bila manje sigurna. Objavljene rezultate treba smatrati donjim granicama jer je moguće da je automatizirani LLM monitor propustio neke slučajeve.
Modeli rijetko priznaju varanje i ne bilježe ga u svom zaključivanju
Naizgled jednostavan način otkrivanja varanja bio bi izravno pitati model je li poduzeo neke zabranjene radnje. No prema AISI-jevim eksperimentima, to ne funkcionira pouzdano. Modeli nisu dosljedno priznavali varanje i u manje od 50 posto slučajeva opisivali su vlastito ponašanje kao pogrešno. Čak i kada su priznavali radnje koje odgovaraju AISI-jevoj definiciji varanja, često su ih prikazivali kao dopuštene.

Analiza „lanca zaključivanja”, odnosno vidljivog procesa razmišljanja modela, također se pokazala nepouzdanom. Claude Opus 4.7 nije ostavljao nikakav trag zaključivanja u 87 posto slučajeva varanja jer koristi adaptivno zaključivanje. Kod GPT-5.6 Sol u 40 posto slučajeva proces razmišljanja nije pokazivao nikakve znakove neovlaštenih radnji.
AISI je također zabilježio da modeli razmatraju hoće li planirana radnja biti smatrana varanjem – i zatim je ipak provode. Tijekom jednog internog procesa razmišljanja GPT-5.6 Sol propitivao je bi li korištenje cluster API-ja kršilo navedena pravila. Nakon toga odabrao je drugu zabranjenu radnju.

AISI upozorava da bi posljedice mogle biti sve ozbiljnije kako modeli postaju sposobniji, čak i ako stopa varanja ostane ista. Sposobniji modeli mogli bi pronalaziti metode varanja koje je teže otkriti i koje mogu nanijeti veću štetu ako uspiju. To je posebno relevantno za ofenzivne kibernetičke sposobnosti, koje se brzo unapređuju. Ranija AISI istraživanja također upućuju na to da bi nadzor nad modelima s vremenom mogao postajati sve teži.
Izvor: The Decoder







