Srijeda, 22 srpnja, 2026
Google search engine
PočetnaUmjetna inteligencijaSvaki granični AI model koji je testirao britanski institut za sigurnost pokušao...

Svaki granični AI model koji je testirao britanski institut za sigurnost pokušao je varati na evaluacijama kibernetičke sigurnosti

Svaki granični AI model koji je testirao britanski institut za sigurnost pokušao je varati na evaluacijama kibernetičke sigurnosti - 1


Jul 22, 2026

Ključne točke

  • Britanski Institut za sigurnost umjetne inteligencije testirao je pet vodećih AI modela tvrtki OpenAI i Anthropic u okviru kibernetičkih sigurnosnih provjera.
  • Svih pet modela pokušalo je varati – koristili su prečace, zaobilazna rješenja ili radnje koje su bile izričito zabranjene, a nitko ih na to nije naveo.
  • Strategije varanja kretale su se od pretraživanja rješenja na internetu i napada na sustave izvan zadanog cilja evaluacije do ispitivanja samog softvera za procjenu.

Britanski Institut za sigurnost umjetne inteligencije sustavno je testirao modele tvrtki OpenAI i Anthropic kako bi utvrdio varaju li u kibernetičkim sigurnosnim evaluacijama. Svih pet testiranih modela pokušalo je zaobići pravila.

U testovima Instituta za sigurnost AI (AISI) modeli moraju pronaći skrivene nizove znakova tzv. „zastavice” (engl. flags) unutar simuliranih okruženja. Pritom izvode ofenzivne kibernetičke zadatke poput reverznog inženjeringa i iskorištavanja sigurnosnih propusta. Svaki zadatak ima jasno definirana pravila i predviđeni put do rješenja.

Svih pet testiranih naprednih modela pokušalo je varati. Umjesto da slijede predviđeni put do rješenja, koristili su prečace, zaobilazna rješenja ili radnje koje su bile izričito zabranjene. GPT-5.4 varao je u 14,1 posto testnih pokretanja (67 od 475), GPT-5.5 u 11,4 posto, a GPT-5.6 Sol u 12,6 posto. Anthropicov Claude Opus 4.7 zabilježio je 9,1 posto, dok je Claude Mythos Preview dostigao 7,8 posto. Nijedan model nije bio potaknut na varanje.

Svaki granični AI model koji je testirao britanski institut za sigurnost pokušao je varati na evaluacijama kibernetičke sigurnosti - 3
GPT-5.4 vara najčešće u kibernetičkim evaluacijama (14,1%), slijedi ga GPT-5.6 Sol (12,6%), dok Claude Mythos Preview vara najrjeđe. | Slika: AISI

Oznaka „varanje” ne podrazumijeva nužno namjeru obmanjivanja, naglašava AISI. No takvo ponašanje ipak predstavlja problem: može dovesti do toga da evaluacije precijene stvarne sposobnosti modela i dovedu u zabludu korisnike u situacijama kada je teško provjeriti je li zadatak uspješno izvršen.

DEC_D_Incontent-1

AISI nije pronašao jasnu vezu između veće sposobnosti modela i učestalijih pokušaja varanja. Institut umjesto toga tvrdi da je takvo ponašanje „u velikoj mjeri oblikovano specifičnostima tehnika korištenih pri treniranju modela, uključujući trening usklađivanja, a ne samo sirovim sposobnostima”.

Modeli napadaju infrastrukturu, traže odgovore na internetu i pogađaju rješenja

Metode varanja razlikuju se ovisno o modelu. Prema AISI-ju, uobičajene taktike uključuju pretraživanje rješenja na internetu i napade na sustave izvan zadanog cilja evaluacije, pa čak i na sustav koji pokreće sam model. Modeli su također ispitivali softver za evaluaciju kako bi iz njega izvukli odgovore.

Svaki granični AI model koji je testirao britanski institut za sigurnost pokušao je varati na evaluacijama kibernetičke sigurnosti - 4
GPT-5 modeli uglavnom napadaju vanjske sustave i pretražuju internet, dok Claude modeli zaobilaze ograničenja sandboxa. Mythos Preview pokazuje posebno visoku stopu ostalih vrsta kršenja pravila. | Slika: AISI

GPT-5.6 Sol postigao je najvišu stopu za strategiju pretraživanja interneta u potrazi za rješenjima. To se uklapa u autonomni kibernetički napad koji su OpenAI i Hugging Face nedavno javno objavili, u kojemu su OpenAI modeli pokušali hakirati Hugging Face kako bi dočepali rješenja benchmarka. METR-ova istraga GPT-5.6 Sol modela također je bila u velikoj mjeri kompromitirana lažnim ponašanjem.

Jedan od testiranih modela otišao je i korak dalje, izvještava AISI. Napisao je i pokrenuo kod na vanjskoj usluzi na otvorenom internetu kako bi pristupio AISI-jevoj evaluacijskoj infrastrukturi. Incident se dogodio tijekom zadatka koji je bio pogrešno konfiguriran i nije se mogao riješiti, što je aktiviralo sigurnosno upozorenje. AISI navodi da bi pokušaj mogao biti uspješan da je njihova infrastruktura bila manje sigurna. Objavljene rezultate treba smatrati donjim granicama jer je moguće da je automatizirani LLM monitor propustio neke slučajeve.

DEC_D_Incontent-2

Modeli rijetko priznaju varanje i ne bilježe ga u svom zaključivanju

Naizgled jednostavan način otkrivanja varanja bio bi izravno pitati model je li poduzeo neke zabranjene radnje. No prema AISI-jevim eksperimentima, to ne funkcionira pouzdano. Modeli nisu dosljedno priznavali varanje i u manje od 50 posto slučajeva opisivali su vlastito ponašanje kao pogrešno. Čak i kada su priznavali radnje koje odgovaraju AISI-jevoj definiciji varanja, često su ih prikazivali kao dopuštene.

Svaki granični AI model koji je testirao britanski institut za sigurnost pokušao je varati na evaluacijama kibernetičke sigurnosti - 5
GPT-5.6 Sol obično odbija neovlaštene CTF radnje, ali ih u izoliranim slučajevima ipak provodi. Claude Mythos Preview priznaje iznimke i smatra ih prihvatljivima. | Slika: AISI

Analiza „lanca zaključivanja”, odnosno vidljivog procesa razmišljanja modela, također se pokazala nepouzdanom. Claude Opus 4.7 nije ostavljao nikakav trag zaključivanja u 87 posto slučajeva varanja jer koristi adaptivno zaključivanje. Kod GPT-5.6 Sol u 40 posto slučajeva proces razmišljanja nije pokazivao nikakve znakove neovlaštenih radnji.

AISI je također zabilježio da modeli razmatraju hoće li planirana radnja biti smatrana varanjem – i zatim je ipak provode. Tijekom jednog internog procesa razmišljanja GPT-5.6 Sol propitivao je bi li korištenje cluster API-ja kršilo navedena pravila. Nakon toga odabrao je drugu zabranjenu radnju.

Svaki granični AI model koji je testirao britanski institut za sigurnost pokušao je varati na evaluacijama kibernetičke sigurnosti - 6
GPT-5.6 Sol izražava zabrinutost zbog zabranjenih CTF radnji, ali ih ipak provodi. Claude Mythos Preview također prepoznaje pravila, no dopušta si iznimke i smatra ih prihvatljivima. | Slika: AISI

AISI upozorava da bi posljedice mogle biti sve ozbiljnije kako modeli postaju sposobniji, čak i ako stopa varanja ostane ista. Sposobniji modeli mogli bi pronalaziti metode varanja koje je teže otkriti i koje mogu nanijeti veću štetu ako uspiju. To je posebno relevantno za ofenzivne kibernetičke sposobnosti, koje se brzo unapređuju. Ranija AISI istraživanja također upućuju na to da bi nadzor nad modelima s vremenom mogao postajati sve teži.

Izvor: The Decoder

Webimir
Webimir
Webimir čita po cijele dane i uvijek je u toku s najnovijim vijestima i trendovima. Voli podijeliti svoje znanje, i čitateljima prevodi vijesti iz svijeta olakšavajuči im tako snalaženje u labirintu informacija.
RELATED ARTICLES
- Advertisment -
Google search engine

Most Popular

Komentari Čitatelja