PočetnaUmjetna inteligencijaCursorov roj agenata sugerira da jeftiniji modeli mogu obaviti većinu programiranja kada...

Cursorov roj agenata sugerira da jeftiniji modeli mogu obaviti većinu programiranja kada modeli s granice planiraju posao

Cursorov roj agenata sugerira da jeftiniji modeli mogu obaviti većinu programiranja kada modeli s granice planiraju posao - 1


Jul 26, 2026

Sustav dijeli agente u dvije uloge: agenti planeri, koji koriste snažne modele s rubnih područja razvoja, rekurzivno razlažu cilj na manje zadatke. Agenti radnici, koji koriste brže i jeftinije modele, te zadatke izvršavaju. Rezultat je stablo zadataka koje se prilagođava kako posao napreduje.

Cursor tvrdi da ta podjela uloga prije svega rješava problem konteksta. Samostalni agent mora prolaziti kroz cijelo stablo zadataka istovremeno imajući na umu i krajnji cilj i trenutni zadatak – što objašnjava zašto agenti gube fokus na dugim poslovima. U Cursorovom roju planeri ne pišu kod, a radnici ne planiraju.

Cursorov roj agenata sugerira da jeftiniji modeli mogu obaviti većinu programiranja kada modeli s granice planiraju posao - 3
Cursor kaže da rojevi skaliraju manje zahvaljujući paralelnom radu, a više zahvaljujući podjeli konteksta između planera koji odlučuju i radnika koji izvršavaju. | Slika: Cursor

Git nije mogao podnijeti 1.000 commitova u sekundi

Raniji Cursorov roj za izradu preglednika dostigao je oko 1.000 commitova na satu u Gitu. Koristio je agente radnike, agenta suca i integratora koji je rješavao konflikte – no integrator je na kraju stvarao više uskih grla nego što ih je uklanjao.

Novi roj dostigao je 1.000 commitova u sekundi, pa je Cursor morao izgraditi vlastiti sustav za kontrolu verzija jer agenti koji rade takvom brzinom generiraju vrste grešaka s kojima ljudski timovi nikada ne dolaze u doticaj.

U onome što je Cursor nazvao „dizajnom podijeljenog mozga”, dva planera bi nesvjesno razvijala isti koncept na različitim mjestima i na različite načine. Situacija je bila još teže upravljiva kada su planeri znali jedni za druge i blokirali se međusobno konkurentskim izmjenama.

Cursor je agentima dao zadatak da bilježe odluke u zajedničkim dokumentima dizajna. Kod vezan uz određenu odluku bio je povezan s tim dokumentom putem reference koja se provjeravala u trenutku kompajliranja.

Kada bi došlo do konflikata pri spajanju, uključivao se neutralni agent koji ih je rješavao. Radnici su označavali prenapuhane datoteke kako bi ih vanjski agent razbio na manje module. Budući da su agenti naučili ne dirati temeljni kod dok rade u postojećim bazama koda uz ljude u petlji, Cursor im je dopustio da namjerno lome stvari. Agent je mogao zakrpati kod izvan svog dodijeljenog područja, a kompajler bi tu promjenu proveo kroz cijeli sustav.

Višestruke perspektive pregleda i priručnik koji agenti sami održavaju

Cursor je testirao nekoliko pristupa pregledu koda. Jedan recenzent dobivao je cijeli transkript radnikovog rada, drugi samo izlaz, a treći samo bazu koda. Nijedna perspektiva sama po sebi nije hvatala sve greške, ali nekorelirane perspektive zajedno su davale veću pouzdanost.

Cursor je također testirao „priručnik” – mapu znanja koju sami agenti održavaju uz ograničen broj redaka. Svaki agent dobivao je njezin sadržaj pri pokretanju. Budući da su težine modela zamrznute, isplati se bilježiti iznenađujuće nalaze kako bi kasniji agenti mogli ići kraćim putem.

Cursor je roju dao priručnik za SQLite od 835 stranica i zadao mu da napravi implementaciju u Rustu. Izvorni kod, testni paketi, SQLite binarni program i pristup internetu bili su uskraćeni. Referentni test bio je sqllogictest – skup testova s milijunima SQL upita i poznatim odgovorima. Roj nije znao da postoji.

Testirane su četiri konfiguracije: GPT-5.5 samostalno, Grok 4.5 samostalno, Opus 4.8 kao planer s Composer 2.5 kao radnikom, te Fable 5 kao planer s Composer 2.5 kao radnikom. Novi sustav nadmašio je stari u svakoj konfiguraciji. Nakon četiri sata, novi pokušaji postigli su između 73 i 85 posto, dok su stari bili između 11 i 77 posto. Sve konfiguracije novog sustava naknadno su dostigle 100 posto.

Stari roj stvarao je više posla nego što ga je završavao

Pokušaji s Grok 4.5 pokazali su zašto je stari sustav zaostajao. Stari roj proizveo je 68.000 commitova u dva sata – otprilike 70 puta više od novog. Većina te aktivnosti bila je uzaludan rad. Stari pokušaj nakupio je više od 70.000 konflikata pri spajanju, dok je novi ostao ispod 1.000 kroz cijeli test.

Cursorov roj agenata sugerira da jeftiniji modeli mogu obaviti većinu programiranja kada modeli s granice planiraju posao - 4
Stopa konflikata u staroj verziji nije se stabilizirala, nego je ubrzano rasla. | Slika: Cursor

Datoteka s najviše konflikata u starom pokušaju zabilježila je 7.771 konflikt od 1.173 agenta, u usporedbi s 47 u novom. Isti problem podijeljenog mozga pojavio se i u strukturi paketa. Stari pokušaj razlomio je projekt na 54 Rust crate-a s tri odvojena SQL paketa. Novi se rano ustabilio na devet crate-ova.

U konfiguraciji s Fable 5, stari roj trebao je 64.305 redaka koda motora, a novi samo 9.908. U konfiguraciji s Opusom, stari sustav proizveo je 19.013 redaka i postigao 97 posto. Novi sustav dostigao je 100 posto s 4.645 redaka.

Cursorov roj agenata sugerira da jeftiniji modeli mogu obaviti većinu programiranja kada modeli s granice planiraju posao - 5
Uz iste ili bolje rezultate na testovima, nova arhitektura smanjila je veličinu baze koda i do 85 posto. | Slika: Cursor

Jeftiniji modeli radnici donijeli su najveće uštedine

Ukupni troškovi kretali su se od 1.339 dolara za hibridnu konfiguraciju s Opusom do 10.565 dolara za GPT-5.5 koji radi samostalno. Radnici su u svakom pokušaju trošili najmanje 69 posto tokena, a najčešće više od 90 posto. Budući da planeri troše skuplje tokene, raspodjela troškova izgledala je drugačije. U hibridnoj konfiguraciji s Opusom, planer je generirao samo mali udio tokena, ali je činio dvije trećine ukupnog računa.

Cursorov roj agenata sugerira da jeftiniji modeli mogu obaviti većinu programiranja kada modeli s granice planiraju posao - 6
Najjeftinija i najskuplja konfiguracija razlikovale su se u cijeni za faktor 15, unatoč usporedivim rezultatima. | Slika: Cursor

Model radnik stvorio je najveću razliku u troškovima. U pokušaju s GPT-5.5, sami radnici koštali su 9.373 dolara. U pokušaju s Opusom i Composerom, cijela flota radnika koštala je 411 dolara uz usporedivu kvalitetu. Razlika gotovo u potpunosti proizlazi iz cijena. Composer 2.5 postiže rezultate na razini Opusa 4.7 i GPT-5.5, ali košta samo 0,50 dolara po milijunu ulaznih tokena i 2,50 dolara po milijunu izlaznih tokena. Model je temeljen na Kimi K2.5, prema riječima Cursorovog osnivača Michaela Truella.

Cursor tvrdi da samo manji dijelovi velikog zadatka zahtijevaju inteligenciju modela s rubnih područja razvoja – primjerice razlaganje zadataka i ključne odluke o dizajnu. Čim planer s rubnog područja razriješi nejasnoće, jeftiniji modeli mogu slijediti njegov plan – premda su hibridni pokušaji pokazali da kvaliteta planera i dalje ima značajan utjecaj. Planer Fable 5 trošio je manje tokena na planiranje od Opusa, ali su njegovi radnici trebali znatno više tokena za dovršetak posla. Pokušaj s Fableom u konačnici je bio skuplji.

Cursorov roj agenata sugerira da jeftiniji modeli mogu obaviti većinu programiranja kada modeli s granice planiraju posao - 7
Radnici su u svakom pokušaju trošili najmanje 69 posto tokena, ali su činili samo dio ukupnih troškova. | Slika: Cursor

Cursor opisuje rojeve kao svojevrsni probabilistički kompajler koji korak po korak prevodi namjeru u izvršivi rad. Tvrtka kaže da je precizno opisivanje te namjere bilo glavni ograničavajući faktor u eksperimentu. Cursor je objavio bazu koda iz samostalnog pokušaja s Opusom kao minisqlite na GitHubu.

Ovakvi pokušaji više nisu ograničeni na laboratorijske eksperimente. Pretprodukcijska verzija Fablea 5 preuzela je veći dio Bunovog prepisivanja iz Ziga u Rust. Šezdeset i četiri instance napisale su više od milijun redaka koda u 11 dana za otprilike 165.000 dolara. Produkcijska primjena ipak još uvijek izgleda drugačije. Studija objavljena krajem 2025. pokazala je da 68 posto agenata u produkcijskoj upotrebi nije izvršilo više od deset koraka prije nego što je čovjek intervenirao. Za 47 posto, granica je bila manje od pet koraka.

AI vijesti bez hype-a – u odabiru ljudi

Pretplatite se na THE DECODER za čitanje bez oglasa, tjedni AI newsletter, naš ekskluzivni izvještaj „AI Radar” šest puta godišnje, pristup cjelokupnom arhivu i mogućnost sudjelovanja u komentarima.

Pretplatite se

Pročitajte cijelu priču. Pretplatite se za izvještavanje bez hype-a.

  • Pristup svim člancima THE DECODER.
  • Čitanje bez ometanja – bez Google oglasa.
  • Pristup komentarima i raspravama zajednice.
  • Tjedni AI newsletter.
  • 6 puta godišnje: „AI Radar” – dubinska analiza ključnih AI tema.
  • Do 25 % popusta na KI Pro online događanja.
  • Pristup našem desetogodišnjem arhivu.
  • Najnovije AI vijesti iz The Decodera.

Pretplatite se na The Decoder

Izvor: The Decoder

Webimir
Webimir
Webimir čita po cijele dane i uvijek je u toku s najnovijim vijestima i trendovima. Voli podijeliti svoje znanje, i čitateljima prevodi vijesti iz svijeta olakšavajuči im tako snalaženje u labirintu informacija.
RELATED ARTICLES
- Advertisment -
Google search engine

Most Popular

Komentari Čitatelja