PočetnaUmjetna inteligencijaAnthropicov Claude Sonnet 5.5 gotovo izjednačuje Opus 5.5 na mjerilima izvedbe, a...

Anthropicov Claude Sonnet 5.5 gotovo izjednačuje Opus 5.5 na mjerilima izvedbe, a pritom košta do 30 posto manje po zadatku.

Anthropicov Claude Sonnet 5.5 gotovo izjednačuje Opus 5.5 na mjerilima izvedbe, a pritom košta do 30 posto manje po zadatku. - 1


Sep 28, 2026

Ključne točke

  • Anthropic je objavio Claude Sonnet 5.5, koji generira odgovore više od 30 posto brže i smanjuje troškove po zadatku do 30 posto zahvaljujući učinkovitijem korištenju tokena.
  • Sonnet 5.5 bilježi značajan napredak na testovima programiranja i uredskog rada, a na nekima gotovo dostiže vrhunski Opus 5.5 – uz znatno niže troškove.
  • Model je već dostupan na AWS-u, Google Cloudu i Azureu. Anthropic je uveo nove zaštitne mjere protiv kibernetičkih prijetnji i napada distilacijom.

Anthropic je objavio Claude Sonnet 5.5, drugi model iz obitelji Claude 5.5. Generira odgovore više od 30 posto brže, košta do 30 posto manje po zadatku i na nekoliko testova gotovo dostiže Opus 5.5.

Opus 5.5 namijenjen je složenim zadacima koji zahtijevaju pažljivo prosuđivanje. Sonnet 5.5 cilja na svakodnevne, jasno definirane poslove poput ispravljanja grešaka u kodu, pisanja dokumentacije, izrade prezentacija i rada s proračunskim tablicama. Anthropic je najavio i Claude Haiku 5.5, koji bi trebao stići u nadolazećim tjednima i biti usmjeren na scenarije s visokim prometom i niskim troškovima.

S modelima Fable, Opus i Sonnet, Anthropic već ima odgovore na OpenAI-eve GPT-6 Astra, Sol i Luna, koji su pokrenuli najnoviji rat cijenama. Grubo govoreći, Opus je nešto iznad Sola, Sonnet iznad Lune, a Fable iznad Astre – premda Anthropic svugdje naplaćuje više. Razlike u performansama između usporedivih razina toliko su male da bi cijena mogla biti presudna. Haiku bi Anthropicu mogao pomoći da smanji taj jaz.

Programerske sposobnosti snažno napreduju

Prema Anthropicovim podacima, najveći napredak Sonneta 5.5 u odnosu na prethodnika vidljiv je upravo u programiranju. Na Terminal-Bench 4.0, testu agentskog kodiranja, Sonnet 5.5 postiže 70,6 posto naspram 10,3 posto koliko je ostvarivao Sonnet 5. Na CursorBench 4.0, koji simulira stvarne programerske sesije iz editora Cursor, Sonnet 5.5 postiže 55,5 posto prema 34,1 posto – svega dva postotna boda ispod Opusa 5.5 (57,8 posto).

Na FrontierCode 1.1 pri postavci „High”, Sonnet 5.5 nadmašuje Sonnet 5 za deset postotnih bodova, i to uz otprilike petnaest puta niže troškove po zadatku, tvrdi Anthropic. Rani testeri pohvalili su brzinu kojom model razumije bazu koda. Sonnet 5.5 također češće grupira pozive alata nego prethodnik, čime se smanjuje broj potrebnih koraka.

Postoji jedna zanimljiva iznimka vezana uz intenzitet zaključivanja. Na najvišoj razini napora, „Max”, Sonnet 5.5 na FrontierCode zapravo postiže lošiji rezultat nego na razini „Xhigh”. Anthropic objašnjava da pri maksimalnom naporu model češće aktivira funkciju pregleda koda koja posao raspoređuje na više podsustava. U nekim slučajevima to je dovodilo do vremenskog prekoračenja ili izmjena izvan zadanog opsega – a oboje FrontierCode kažnjava.

Uredski rad gotovo na razini Opusa 5.5

Na GDPval-AA, testu uredskog rada koji je razvio OpenAI i koji obuhvaća zadatke iz 44 struke i devet industrija, Sonnet 5.5 postiže 1.844 boda. To je gotovo jednako Opusu 5.5 (1.846) i oko 400 bodova više od Sonneta 5 (1.449). OpenAI-ev GPT-6 Sol prema Anthropicovim podacima stoji na 1.487. Na Chartographyju, testu vizualnog prepoznavanja dijagrama, Sonnet 5.5 skače s 15,6 na 61,6 posto.

Kategorija Test Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Agentsko programiranje Terminal-Bench 4.0 70,6% 10,3% 66,4%¹ —
Agentsko programiranje FrontierCode 1.1 (Main) 46,2% (Max); 52,1% (Xhigh)² 42,4% 54,4% 49,3%
Agentsko programiranje CursorBench 4.0 55,5% 34,1% 57,8% —
Uredski rad GDPval-AA v2.1³ 1.844 1.449 1.846 1.487
Uredski rad AA Briefcase v1.1³ 1.811 1.359 1.822 1.483
Interdisciplinarno razmišljanje Humanity’s Last Exam (s alatima) 64,5% 54,9% 67,7% —
Računalne vještine OSWorld 2.1 (djelomična evaluacija) 80,1% 57,0% 81,8% —
Vizualno prepoznavanje dijagrama Chartography (bez alata) 61,6% 15,6% 64,4% 53,6%

¹ Za Opus 5.5, Terminal-Bench 4.0 prikazuje najviši rezultat pri postavci „Xhigh”. ² Sonnet 5.5 postiže niži rezultat na FrontierCode pri postavci „Max” nego pri „Xhigh”. ³ Vrijednosti za Sonnet 5.5 potječu iz pretprodukcijske verzije u kojoj je naknadni ispravak greške mogao utjecati na strukturirane izlaze.

Rani testeri opisali su Sonnet 5.5 kao prirodnijeg sugovornika s osjećajem za dizajn. Model može preraditi korisničke sučelje i primijeniti predloške za prezentacije toliko uspješno da rezultati gotovo ne zahtijevaju doradu, tvrdi Anthropic.

Anthropic također navodi da je Sonnet 5.5 prvi Sonnet model koji može igrati Pokémon Red koristeći isključivo snimke zaslona. OpenAI-ev Astra nedavno je pokazao sličan napredak na igračkim testovima. Takvi su zadaci još prije nekoliko godina smatrani iznimno zahtjevnima i često su zahtijevali posebno razvijene algoritme. Danas ih mogu rješavati čak i modeli srednje razine unutar iste obitelji proizvoda.

Ista cijena po tokenu, manji broj tokena po zadatku

Sonnet 5.5 košta jednako po milijunu tokena kao i Sonnet 5: $2 za ulazne tokene, $10 za izlazne i $0,20 za čitanje iz predmemorije. Budući da model troši manje tokena po zadatku, stvarni troškovi padaju do 30 posto, tvrdi Anthropic. Generiranje odgovora također je više od 30 posto brže. Neovisna testiranja tek trebaju potvrditi te tvrdnje.

Cijena po milijunu tokena Claude Opus 5.5 GPT-6 Sol Claude Sonnet 5.5 GPT-6 Luna
Ulazni tokeni $4 $2 $2 $0,10
Izlazni tokeni $20 $10 $10 $0,50
Čitanje iz predmemorije $0,20 $0,20 $0,20 $0,01
Pisanje u predmemoriju $5 $2,50 $2,50 $0,125

Kao i ostali Anthropicovi modeli te OpenAI-evi pandani, Sonnet 5.5 nudi podesive razine napora koje korisnicima omogućuju da biraju između brzine i cijene s jedne strane te kvalitete rezultata s druge. Na niskim ili srednjim postavkama Sonnet 5.5 već nadmašuje najbolje rezultate Sonneta 5 na nekoliko testova – uz otprilike desetinu troškova po zadatku, tvrdi Anthropic. Ipak, pronalaženje optimalne razine napora za svaki zadatak i dalje je više umijeće nego egzaktna znanost.

Nove zaštitne mjere za sposobniji model

Claude Sonnet 5.5 već je dostupan na svim glavnim platformama u oblaku, uključujući Amazon Web Services, Google Cloud i Microsoft Azure. Kao i Opus 5.5 i Sonnet 5, model se nudi bez pohrane podataka. Programeri mu mogu pristupiti putem Claude platforme koristeći identifikator modela „claude-sonnet-5-5″.

Budući da je Sonnet 5.5 znatno sposobniji na području kibernetičke sigurnosti od svog prethodnika, Anthropic po prvi put uvodi zaštitne mjere i za Sonnet model. Zahtjevi koji uključuju visokorizične kibernetičke zadatke vidljivo se preusmjeravaju na Sonnet 5. Putem proširenog Programa kibernetičke verifikacije, kvalificirani stručnjaci mogu zatražiti pristup s različitim razinama ovlasti.

Anthropic je također dodao sigurnosne klasifikatore protiv napada distilacijom, iste vrste koje koristi u svojim najmoćnijim modelima. Hoće li te mjere zaista biti učinkovite, trebalo bi postati jasno u nadolazećim mjesecima. Ako su kineski laboratoriji imali koristi od takvih napada, zatvaranje tog kanala moglo bi ponovno povećati prednost zapadnih laboratorija.

Izvor: The Decoder

Webimir
Webimir
Webimir je redakcijski profil portala webimir.com. Svakodnevno pratimo vodeće svjetske izvore o tehnologiji – mobitele, umjetnu inteligenciju, gadgete, automobile, kriptovalute i kinesko tech tržište – i donosimo najvažnije vijesti na hrvatskom jeziku, sažeto i razumljivo. Uz svaki članak navodimo izvornu vijest, tako da original uvijek možete provjeriti sami.
POVEZANI ČLANCI
- Advertisment -
Google search engine

Najpopularnije

Komentari čitatelja