PočetnaUmjetna inteligencijaMeta AI koristi drugog AI agenta kao trenera pamćenja kako bi dugi...

Meta AI koristi drugog AI agenta kao trenera pamćenja kako bi dugi zadaci ostali na pravom putu

Meta AI koristi drugog AI agenta kao trenera pamćenja kako bi dugi zadaci ostali na pravom putu - 1


Aug 2, 2026

Tijekom dugotrajnih zadataka AI agenti često zaboravljaju ograničenja, ponavljaju naredbe koje su već propale i iznova otkrivaju pogreške koje su već dijagnosticirali. Modul memorije koji predlaže Meta AI prati te informacije i sam odlučuje kada ih treba podsjetiti.

U novom istraživačkom radu, istraživači Meta AI-a opisuju kako ti propusti izgledaju u praksi. Agent rano prepozna neko ograničenje, ali ga kasnije prekrši dok ispravlja nepovezanu grešku. Vidi da je naredba propala, a ubrzo zatim pokuša gotovo identičnu varijantu. Dijagnosticira obrazac pogreške, a potom isti obrazac tretira kao nešto novo.

Autori taj fenomen nazivaju “raspadom bihevioralnog stanja”. Stanje koje usmjerava agentove odluke raspršuje se po sve dužoj povijesti zadatka – može biti zakopano duboko u kontekstnom prozoru ili iz njega potpuno ispasti. Čak i kad informacija ostane u transkriptu ili kontekstnom prozoru, ne mora nužno pouzdano utjecati na agentovo ponašanje. Meta AI tvrdi da samo davanje agentu pristupa dužim povijestima ne rješava problem.

Kada memorija uopće ima smisla

Postojeći sustavi memorije usredotočeni su na pohranu, ažuriranje i dohvaćanje informacija. Prema radu, to dobro funkcionira za personalizaciju i prisjećanje između sesija. No agenti koji rade na zadatku suočavaju se s drugačijim problemom: sustav mora odlučiti kada je neka memorija dovoljno korisna da je vrijedi aktivirati. Premalo podsjetnika vodi do ponavljanja grešaka, a previše ih usporava rad, troši tokene i odvlači agenta od trenutnog zadatka.

To nadilazi puku sumarizaciju: sumarizator samo odlučuje koje informacije zadržati, dok Metin sustav odlučuje treba li pohranjena izvršna stanja uopće utjecati na agentov sljedeći korak. Budući da se načini otkazivanja uvelike razlikuju ovisno o zadatku, fiksno pravilo sumarizacije ne može tu odluku donijeti pouzdano.

Drugi agent odlučuje kada progovoriti

Predloženi sustav spaja nemodificiranog “agenta za akciju” s posebnim “agentom za memoriju”. U fiksnim intervalima, agent za memoriju pregledava klizni prozor najnovijih koraka i ažurira strukturiranu memorijsku banku. Potom odlučuje hoće li dodati kratki podsjetnik u sljedeći poziv agenta za akciju ili ostati tih.

Autori navode da se modul može koristiti s postojećim agentima i okvirima kao plug-and-play komponenta. Za razliku od općeg savjetničkog modela, pruža isključivo podsjetnike temeljene na memoriji i ne nudi šire strateške savjete.

Meta AI koristi drugog AI agenta kao trenera pamćenja kako bi dugi zadaci ostali na pravom putu - 3
Agent za memoriju radi usporedno s nemodificiranim agentom za akciju i pri svakoj zakazanoj provjeri odlučuje hoće li dodati podsjetnik ili ostati tih. | Slika: Meta

Memorijska banka ima tri odjeljka. Privatno polje statusa prati napredak i otvorene rizike i nikada se ne prikazuje agentu za akciju. Memorija znanja pohranjuje stabilne činjenice poput zahtjeva, putanja datoteka i konfiguracija. Proceduralna memorija bilježi što je agent pokušao i što se dogodilo – uključujući propale naredbe, uspješne ispravke i odbačene hipoteze.

Tijekom svakog koraka memorije, agent može ažurirati banku samo putem unaprijed definiranih poziva alata, a ne slobodnim prepisivanjem sadržaja. Potom odlučuje treba li aktivirati pohranjeno stanje i, ako je potrebno, piše ciljani podsjetnik. Odluka da se ne intervenira dio je same politike.

Meta AI koristi drugog AI agenta kao trenera pamćenja kako bi dugi zadaci ostali na pravom putu - 4
U fazi 1, agent ažurira svoju strukturiranu memorijsku banku. U fazi 2, odlučuje treba li neka pohranjena memorija utjecati na sljedeću odluku agenta za akciju. | Slika: Meta

Selektivni podsjetnici poboljšavaju rezultate na dvama mjerilima

Istraživači su sustav testirali na Terminal-Bench 2.0, koji procjenjuje autonomne agente u realističnim okruženjima naredbenog retka. Koristili su i tau2-Bench, koji testira konverzacijsko korištenje alata u sektorima zrakoplovstva, maloprodaje i telekomunikacija. Claude Opus 4.6 poslužio je kao agent za memoriju, premda je model od tada dobio nekoliko ažuriranja.

Sa starijim Claude Sonnet 4.5 kao agentom za akciju, sustav je riješio 46 posto zadataka na Terminal-Bench u prvom pokušaju. Osnovna verzija riješila je 38 posto. Na tau2-Bench, ponderiran prosjek po zadacima porastao je s 55 na 62 posto.

Rezultati su se razlikovali po domenama. Rezultati za zadatke iz zrakoplovstva i maloprodaje porasli su svaki za oko 10 postotnih bodova, dok su telekomunikacije napredovale samo za 3 boda. Istraživači kažu da neravnomjerni dobici upućuju na to da agent za memoriju intervenira različitim intenzitetom ovisno o zadatku, umjesto da primjenjuje fiksno pravilo agregacije.

Dobici su bili veći uz slabijeg agenta, ali nisu nestali ni uz jačeg. Opus 4.6 poboljšao se za 2,4 postotna boda na Terminal-Bench i 2,5 boda na tau2-Bench. Taj rezultat sugerira da memorijski sustav ne služi samo kao kompenzacija za ograničene kapacitete slabijeg modela.

Selektivno interveniranje bolje od stalnog prisjećanja

Tim je uklanjao jednu sposobnost po jednu kako bi utvrdio koji dijelovi sustava donose poboljšanja. Kada je agent za akciju dobivao punu memorijsku banku na svakom koraku, rezultati su pali ispod razine punog sustava. Verzija bez opcije “šutnje” – koja je vraćala memoriju na svakom koraku – ostala je konkurentna, ali je davala manje dosljedne dobitke po domenama.

Verzija u stilu savjetnika bez trajne memorijske banke pomogla je u nekim područjima, ali je narušila rezultate u drugima. Puni dizajn, koji kombinira održavanu memorijsku banku sa selektivnim podsjetnicima, pokazao se najboljim.

Pristup je nadmašio i Mem0, produkcijski memorijski sloj koji dohvaća zapise putem pretraživanja. Razlika nije samo u tome koje zapise sustav dohvaća – agent za memoriju također odlučuje treba li i kako pohranjena stanja ući u petlju kao ciljani podsjetnik.

Primjer iz domene “Airline” na tau2-Bench pokazuje kako to funkcionira. Korisnik je tvrdio da ima Gold status, ali ga je alat identificirao kao redovnog kupca. Osnovna verzija dodijelila je naknadu na temelju korisnikove tvrdnje. Agent za memoriju umjesto toga izdao je podsjetnik da se osloni na verificirane podatke iz alata.

Većina preostalih pogrešaka ticala se kalibracije, a ne memorije. U nekim slučajevima, primjerice, agent za memoriju tretirao je spekulativni zaključak s previše pouzdanja.

Manji otvoreni modeli trebaju trening za dobro upravljanje memorijom

Glavna verzija ne zahtijeva posebno istreniran model i umjesto toga radi kao agent s promptovima. Tim je također ispitao može li se politika interveniranja naučiti otvorenom modelu. Istrenirali su manji Qwen3.5-27B kao agent za memoriju, dok je znatno veći agent za akciju ostao zamrznut.

Bez treninga, manji agent za memoriju smanjio je rezultate. Nadzirano fino podešavanje nadoknadilo je taj gubitak, a kasniji pojačavajući trening poboljšao je njegove odluke o tome kada aktivirati pohranjeno stanje.

Meta AI navodi nekoliko otvorenih pitanja, uključujući zajedničko treniranje agenata za memoriju i akciju, učenje sustava da sam poziva memoriju kada je potrebno umjesto da slijedi fiksni raspored, te određivanje kada doslovna memorija funkcionira bolje od apstrakcija specifičnih za zadatak.

Meta AI objavio je kod projekta na GitHubu.

Meta nije jedina koja se suočava s ovim problemom, a industrija još uvijek nema standardni pristup. Otvoreni Mastra okvir koristi dva pozadinska agenta koji nadziru i komprimiraju razgovor umjesto da čuvaju njegovu punu povijest u kontekstnom prozoru. Sustav GAM nastoji spriječiti “trulež konteksta” u dugim razgovorima i, poput Metinog pristupa, uspoređuje svoje rezultate s memorijskim slojem Mem0. Drugi istraživači razvijaju sustave doživotne AI memorije koji mogu aktivno dodavati, revidirati i zaboravljati znanje.

AI vijesti bez hype-a – u odabiru ljudi

Pretplatite se na THE DECODER za čitanje bez oglasa, tjedni AI newsletter, naš ekskluzivni izvještaj “AI Radar” šest puta godišnje, pristup punom arhivu i mogućnost sudjelovanja u komentarima.

Pretplatite se

Pročitajte cijeli članak. Pretplatite se za izvještavanje bez hype-a.

  • Pristup svim člancima na THE DECODER.
  • Čitanje bez ometanja – bez Google oglasa.
  • Pristup komentarima i raspravama zajednice.
  • Tjedni AI newsletter.
  • 6 puta godišnje: “AI Radar” – dubinska analiza ključnih AI tema.
  • Do 25 % popusta na KI Pro online događanja.
  • Pristup našem punom desetogodišnjem arhivu.
  • Najnovije AI vijesti iz The Decoder.

Pretplatite se na The Decoder

Izvor: The Decoder

Webimir
Webimir
Webimir čita po cijele dane i uvijek je u toku s najnovijim vijestima i trendovima. Voli podijeliti svoje znanje, i čitateljima prevodi vijesti iz svijeta olakšavajuči im tako snalaženje u labirintu informacija.
RELATED ARTICLES
- Advertisment -
Google search engine

Most Popular

Komentari Čitatelja