PočetnaUmjetna inteligencijaMETR uvodi novu metriku za precizno izračunavanje kada AI agenti postaju skuplji...

METR uvodi novu metriku za precizno izračunavanje kada AI agenti postaju skuplji od ljudi

METR uvodi novu metriku za precizno izračunavanje kada AI agenti postaju skuplji od ljudi - 1


Jul 27, 2026

METR-ova nova mjera, tzv. „expenditure horizon”, izražava u dolarima koliko je isplativo koristiti AI agente za rješavanje problema. Prvi rezultati na NanoGPT speedrunu nisu impresivni, mjera ima određena ograničenja, a najnovija generacija modela mogla bi promijeniti sliku.

Jedno od ključnih pitanja u istraživanju umjetne inteligencije jest može li AI ubrzati vlastiti razvoj i nastaviti napredovati sve bržim tempom. To je dosad bilo teško izmjeriti jer zahtijeva usporedbu troškova koji su po prirodi vrlo različiti: ljudskog rada, računalnih resursa za eksperimente i troškova samog pokretanja AI sustava.

Istraživačka organizacija METR predlaže novu mjeru za taj problem: „expenditure horizon”. METR uspoređuje koliko AI, a koliko čovjek mora potrošiti kako bi postigli isti napredak. Expenditure horizon je točka u kojoj su ti troškovi izjednačeni. Ispod tog iznosa AI je isplativiji, a iznad njega čovjek radi jeftinije.

METR uvodi novu metriku za precizno izračunavanje kada AI agenti postaju skuplji od ljudi - 3
Zelena linija prikazuje povrat od ljudskog rada, crvena krivulja povrat AI agenta. Točka u kojoj se sijeku jest expenditure horizon. | Slika: METR

Ideja se temelji na obrascu koji je METR uočio u ranijim testovima: AI agenti često brže rješavaju jednostavne, jeftine zadatke od ljudi. No kako budžeti rastu i zadaci postaju zahtjevniji, AI zaostaje.

U usporedbi s uobičajenim AI mjerilima, ova metoda ima dvije prednosti, prema METR-u. Prvo, ne daje samo binarni odgovor prolaz/pad, nego preciznu vrijednost koja pokazuje koliko napretka dobivate za određeni iznos novca. Drugo, sve troškove pretvara u jednu zajedničku valutu – obuhvaća ne samo troškove pokretanja AI-ja, već i skupe računalne resurse za eksperimente te sate ljudskog rada.

Ljudi troše oko 2.500 dolara za svaki posto ubrzanja

METR je za testiranje odabrao NanoGPT speedrun. Riječ je o javnom zajedničkom projektu u kojem volonteri natječu tko će što brže istrenirati AI jezični model. Zadatak ostaje isti, mijenja se samo pristup treniranju. Od svibnja 2024. potrebno vrijeme treniranja na standardiziranom hardveru smanjilo se s oko 45 minuta na manje od dvije minute, kroz 82 dokumentirana koraka poboljšanja.

METR uvodi novu metriku za precizno izračunavanje kada AI agenti postaju skuplji od ljudi - 4
Vremenska crta NanoGPT speedruna: 82 koraka poboljšanja donijela su ukupno 33 puta brže izvođenje. | Slika: METR

Kako bi procijenio troškove ljudskog rada, METR je intervjuirao dvojicu najaktivnijih suradnika na projektu, a AI model (Opus-4.6) zamolio je da procijeni trud uložen u svako poboljšanje. Oba pristupa dala su sličan rezultat: otprilike 16 sati rada po jednom postotku ubrzanja. Uz pretpostavljenu satnicu od 150 dolara, to iznosi oko 2.500 dolara po postotnom bodu.

METR naglašava da je taj broj vrlo neizvjestan. Jedan detalj iz intervjua posebno se ističe: većina vremena otišla je na ideje koje na kraju nisu zaživjele.

AI agenti dosad su dali tek skroman doprinos

Za usporedbu, METR je šest AI modela pustio da neovisno rade na istom zadatku. Nisu kretali od nule, nego od već visoko optimiziranog stanja speedruna (rekord #78 iz ožujka 2026.) i smjeli su potrošiti do 10.000 dolara po pokretanju na računalne i operativne troškove. Rezultat: procijenjeni expenditure horizoni između 0 i 3.300 dolara.

METR uvodi novu metriku za precizno izračunavanje kada AI agenti postaju skuplji od ljudi - 5
Krivulje AI modela u usporedbi s ljudskim radom (sjecište pri otprilike 2.500 dolara po postotku). Jedino GPT-5.5 i Opus-4.8 dosežu smislene expenditure horizone. | Slika: METR

Razlike između modela bile su izrazite. GPT-5 i Opus-4.1 nakon pažljive provjere nisu pokazali nikakav stvarni napredak – prividni dobici pokazali su se kao slučajni šum. GPT-5.5 i Opus-4.8, s druge strane, postigli su stvarna poboljšanja od oko 1, odnosno 1,5 posto.

Kvaliteta ideja koje su generirali AI modeli bila je neujednačena. Voditelj speedruna procijenio je da bi se oko 70 posto njih načelno moglo ugraditi u projekt, ali mnoge nisu bile osobito originalne. Jednu domišljatu niskorazinsku optimizaciju GPT-5.5 pohvalio je kao „najzanimljiviju”, dok je ostatak opisao uglavnom kao podešavanje parametara. Modeli su se i više puta pokušali izvući prečacima – koristili su trikove koji su u testiranju davali dobre rezultate, ali bi u praksi bili beskorisni, poput isključivanja dijelova treniranja tik pred kraj.

METR-ov zaključak: iako pojedini modeli dosežu expenditure horizone u nižem četveroznamenkastom rasponu, ti su iznosi zanemarivi u usporedbi s procijenjenih 250.000 dolara ukupnog ljudskog truda. Autonomna optimizacija dosad gotovo da nije pomaknula iglu u NanoGPT speedrunu.

Zašto bi najnovija generacija AI modela mogla promijeniti sliku

Važna napomena: METR je testirao samo starije modele (GPT-5, GPT-5.2, GPT-5.5 te Opus-4.1 i Opus-4.8). Modeli objavljeni nakon toga – Fable 5, GPT-5.6 Sol i Opus 5 – ne pojavljuju se u studiji. Anthropic predstavlja Opus 5 kao veliki iskorak: na testu Frontier-Bench postiže dvostruko bolje rezultate od Opusa 4.8 uz niži trošak po zadatku. Prema Anthropicu, Opus 5 manje vremena troši na slijepe ulice, pouzdanije provjerava vlastiti rad i postiže sličnu razinu uz prosječno 26 posto manje računalnih koraka. Sve su to čimbenici koji izravno utječu na METR-ov expenditure horizon.

Napredak na ARC-AGI-3 još je rječitiji. To mjerilo ne testira zapamćeno znanje, nego stvarno rješavanje problema: AI se bez ikakvih uputa ili ciljeva ubacuje u nepoznata, igri slična okruženja i sve mora otkriti metodom pokušaja i pogreške. Opus 5 drži prvo mjesto od 24. srpnja 2026. s rezultatom od 30,2 posto i riješio je pet zadataka koje nijedan prethodni model nije uspio. Njegov prethodnik Opus 4.8 postigao je svega 1,5 posto. Tim ARC Prize napredak pripisuje boljem logičkom zaključivanju, koje AI-ju omogućuje neovisnije istraživanje i planiranje. Takva sposobnost mogla bi se pokazati korisnom i u NanoGPT speedrunu.

Studija zanemaruje najčešći scenarij: suradnju čovjeka i AI-ja

Možda najveće ograničenje jest ono koje METR sam ističe: cijela studija mjeri AI koji radi samostalno, u potpuno autonomnom načinu rada. U stvarnom AI istraživanju ljudi AI tipično koriste kao alat. METR skicira treću, hipotetsku krivulju za taj scenarij. Ako ljudi pametno odlučuju kada i kako koristiti AI, ta hibridna krivulja trebala bi teorijski nadmašiti i čisto ljudsku i čisto AI krivulju, kombinirajući prednosti obaju pristupa.

METR uvodi novu metriku za precizno izračunavanje kada AI agenti postaju skuplji od ljudi - 6
Hipotetska hibridna krivulja (plava): kada ljudi mudro koriste AI, teorijski bi trebala nadmašiti i čisto ljudsku i čisto AI krivulju. | Slika: METR

METR ipak umanjuje ta očekivanja, pozivajući se na vlastita ranija istraživanja koja pokazuju da kombinacija čovjeka i AI-ja ponekad daje lošije rezultate nego sam čovjek. Dodana vrijednost nije zajamčena i ovisi o tome koristi li se AI na pravim mjestima. Pravo mjerenje zahtijevalo bi kontrolirani eksperiment u kojem bi isti istraživači radili s AI podrškom i bez nje. Takav eksperiment teško je organizirati, ali METR kaže da bi bio iznimno informativan. Dok se to ne dogodi, expenditure horizon govori mnogo o tome što AI može sam – no vrlo malo o tome koliko zapravo ubrzava rad ljudskih istraživača.

Read on for the full picture.
Subscribe for hype-free coverage.

  • Access to all THE DECODER articles.
  • Read without distractions – no Google ads.
  • Access to comments and community discussions.
  • Weekly AI newsletter.
  • 6 times a year: “AI Radar” – deep dives on key AI topics.
  • Up to 25 % off on KI Pro online events.
  • Access to our full ten-year archive.
  • Get the latest AI news from The Decoder.

Subscribe to The Decoder

Izvor: The Decoder

Webimir
Webimir
Webimir čita po cijele dane i uvijek je u toku s najnovijim vijestima i trendovima. Voli podijeliti svoje znanje, i čitateljima prevodi vijesti iz svijeta olakšavajuči im tako snalaženje u labirintu informacija.
RELATED ARTICLES
- Advertisment -
Google search engine

Most Popular

Komentari Čitatelja