4. listopada 2026.
AI agenti koji neprestano optimiziraju vlastito radno okruženje brzo se pretjerano specijaliziraju za zadatke na kojima su testirani. Nova metoda istraživača iz Google Cloud AI Researcha i nekoliko sveučilišta nastoji to spriječiti, a uz to smanjuje i računalne troškove.
Moderni AI agenti omotavaju nepromijenjeni jezični model u tzv. harness — okvir sastavljen od uputa, radnih tokova, alata, memorije i logike koji određuje što model vidi u svakom koraku.
Harness odlučuje hoće li agent pročitati ispravnu datoteku prije nego što je izmijeni, hoće li se oporaviti od pogreške i hoće li rezultate isporučiti uredno. Prema novom istraživačkom radu, velik dio nedavnog napretka u razvoju agenata dolazi upravo od rada na harnessu, a ne od novih modela.
Do nedavno se to radilo ručno. Ljudi su pregledavali neuspjele pokušaje i ručno krpali harness. Novije metode taj proces automatiziraju tako da jezični model iznova i iznova prepisuje sam harness na temelju povratnih informacija s testnih zadataka.
Istraživači to nazivaju praktičnim oblikom rekurzivnog samounapređenja. Sustav generira povratne informacije koje koristi za optimizaciju harnessa, koji pak kontrolira ponašanje samog sustava.
Samoptimizacija tjera agente da napamet uče testne zadatke
Rad pokazuje da samoptimizacija ima svoju cijenu. Budući da agent neprestano radi na istom ograničenom skupu testnih zadataka, na kraju ih jednostavno zapamti. Rezultati na zadacima za treniranje rastu, dok napredak na novim, neviđenim zadacima slabi ili potpuno nestaje.
Istraživači navode da se to događa na nekoliko načina: pretraga pamti obrasce koji odgovaraju samo jednom konkretnom benchmarku, favorizira kandidate koji slučajno postignu dobre rezultate i nagomilava nepotrebnu složenost koja podiže testni rezultat, a da agent zapravo ne postaje bolji.
Ostale metode uglavnom napreduju na zadacima za treniranje, no malo toga se prenosi na neviđene benchmarke. RRSI poboljšava rezultate u sva tri područja. | Slika: Google
Smanjeni budžet izmjena i strogi kritičar čuvaju općenitost harnessa
RRSI (Regularized Recursive Self-Improvement of Agent Harnesses) djeluje na oba kraja petlje optimizacije, a harness ostaje u potpunosti editabilan. Kada sustav predlaže nove izmjene, budžet ograničava koliko neovisnih izmjena kandidat može odjednom obuhvatiti.
Taj se budžet s vremenom smanjuje. U ranim rundama dopuštena su veća prepisivanja, dok kasniji krugovi dopuštaju samo male izmjene koje se jasno mogu pratiti do konkretnog rezultata. Sustav također prati ranije pokušaje kako ne bi iznova slijedio iste neuspješne ideje. Kada napredak zastane, namjerno eksperimentira s dijelovima harnessa kojih se još nije dotakao.
RRSI ograničava samoptimizaciju na dvije točke — pri predlaganju novih izmjena i pri odlučivanju koje od njih postaju trajni dio harnessa. | Slika: Google
Kada je riječ o odabiru izmjena, kritičar pregledava svaki prijedlog i odbacuje one koji tvrdo kodiraju nazive zadataka, rješenja ili druge trikove specifične za određeni benchmark. Još jedno pravilo prihvaća veće računalne troškove samo ako donose mjerljiv napredak u izvedbi. Komponente koje više ne pomažu se uklanjaju.
Odricanje od dobitaka na treniranju isplati se na novim zadacima
Istraživači su RRSI testirali na osam benchmarka koji pokrivaju programiranje, agentni uredski rad i inženjerski dizajn. Temeljni model, Claude Opus 4.8, ostao je nepromijenjen tijekom cijelog procesa. Tim je usporedio RRSI s nemodificiranim osnovnim harnessom i četiri nedavne metode optimizacije.
Prema radu, RRSI postiže do 14,1 bod više na zadacima na kojima je treniran i do 4,7 bodova više na pet benchmarka koje nikada nije vidio. Uz to, pri izvođenju troši otprilike 30 posto manje tokena od neregularizirane verzije. Ukupna izvedba ni na jednom neviđenom benchmarku nije pala ispod osnovne razine, što se inače redovito događa s harnessom koji je zapamtio svoje zadatke.
RRSI harness poboljšava rezultate na svakom zadatku izvan skupa za treniranje, s najvećim dobitkom od 4,7 bodova na JobBenchu. | Slika: Google
Sve su metode dobro prošle na zadacima za treniranje, no na novim zadacima slika se okrenula. Dvije metode čak su završile ispod osnovnog harnessa. RRSI je zabilježio najmanji dobitak na treniranju od svih varijanti i jedina je metoda koja je na neviđenim zadacima završila znatno iznad osnovne razine. Upravo je takav kompromis cilj zaštitnih mehanizama.
Među optimiziranim harnesima, RRSI troši najmanje tokena i koraka te postiže najbolje rezultate na novim zadacima, iako je nemodificirani osnovni harness još štedljiviji. | Slika: Google
Harness optimiziran za jedan model pomaže i slabijima
Harness za programiranje optimiziran uz pomoć Gemini 3.5 Flash podigao je točnost znatno slabijeg Gemini 3.1 Flash Lite s 11,2 na 14,6 bodova bez ikakvih dodatnih izmjena. Mehanizmi koje je sustav otkrio ne ovise o sposobnostima modela koji ih je pronašao.
Autori napominju da njihova studija obuhvaća samo harnesses izgrađene oko nepromijenjenih modela i ne bavi se slučajevima u kojima se mijenjaju težine modela.
Zaključuju da samounapređenje čini AI agente pouzdano sposobnijima samo kada se ponavljajuće povratne informacije pretvaraju u trajne promjene. Kod je dostupan na GitHubu.
Ručno dizajnirani harnesses često se ne generaliziraju na nove zadatke, što su pokazali testovi na ARC-AGI-3. S namjenski izrađenim harnessom, Opus 4.6 postigao je 97,1 posto u poznatom okruženju i 0 posto u nepoznatom. Nvidia je nedavno predstavila SoL-Pi, srodnu metodu u kojoj istraživački agent automatski rekonstruira harness agenata za programiranje. Ona smanjuje potrošnju tokena za do 49 posto bez zamjetnog pada u izvedbi.
Nedugo prije toga, Google je agentima omogućio da „sanjaju” o prošlim pretragama kako bi unaprijedili svoju strategiju pretraživanja. I taj rad ostavlja sam model nepromijenjenim.
Pročitajte cijeli članak.
Pretplatite se za izvještavanje bez hype-a.
- Puni pristup svim člancima na THE DECODER
- Bez reklama
- Sudjelujte u komentarima i raspravama zajednice
- Tjedni pregled AI vijesti putem e-pošte
- 6x godišnje: „AI Radar” — dubinske analize najvažnijih AI tema
- Dnevne AI vijesti, uvijek ažurne
- Pristup našem desetogodišnjem arhivu
- Tim s više od 10 godina iskustva u AI-ju
Pretplatite se na The Decoder
Izvor: The Decoder







