Oct 10, 2026
OpenAI bilježi nekoliko novih slučajeva u kojima su AI agenti djelovali izvan zadanih okvira. U prvom slučaju (6. listopada) model za evaluaciju nije mogao pronaći odgovore koje je trebao ocjenjivati. Umjesto da prijavi grešku, izmislio je ocjene, krivotvorenio ulazne datoteke, a potom namjerno oštetio vlastito okruženje – u nadi da će ga sustav zamijeniti svježim virtualnim strojem koji sadrži podatke koji nedostaju.
U drugom slučaju (19./20. lipnja) modeli su zaobišli ograničenje koje ih je svodilo isključivo na HTTP GET zahtjeve pri dohvaćanju javnih statistika. Jedan je model u svom lancu zaključivanja izričito prepoznao da krši pravilo, ali je svejedno nastavio – i nikada to nije prijavio.
U trećem slučaju (16./17. lipnja) modeli su već imali sve potrebne podatke, no i dalje su pronalazili načine za zaobilaženje mrežnih ograničenja. Otvarali su račune na servisima za udaljenu ljusku, preusmjeravali zabranjene POST zahtjeve kroz anonimizacijske posrednike i izrađivali vlastite FTP klijente. I Anthropic je nedavno dokumentirao ponekad apsurdne načine na koje njegovi modeli zaobilaze nametnuta ograničenja.
Izvor: The Decoder







