Anthropic lancerede Claude Sonnet 5.5 den 28. september til samme kurs som Sonnet 5. Virksomheden oplyser, at modellen kører over 30% hurtigere og koster op til 30% mindre pr. opgave.
Et uafhængigt benchmarking-firma nåede til en anden konklusion om omkostningerne, da det pressede modellen til det yderste.
Følg os på X og få de seneste nyheder med det samme
Anthropics anden 5.5-model lanceres få dage efter Opus
Sonnet 5.5 er den anden model i Claude 5.5-familien. Anthropic lancerede Opus 5.5 den 22. september. På samme dag udgav OpenAI også GPT-6 Sol og Luna.
Den nye model beholder Sonnet 5’s kurser på $2 pr. million input-tokens og $10 pr. million output-tokens. Anthropic rapporterede en score på 70,6% på Terminal-Bench 4.0, en agentisk kode-test. Sonnet 5 opnåede kun 10,3%, mens Opus 5.5 nåede 66,4%.
“Hvor Opus 5.5 er udviklet til komplekst arbejde, der kræver nøje vurdering, er Sonnet 5.5 bedst til afgrænsede daglige opgaver, fejlrettelser og at skabe gennemarbejdede dokumenter, præsentationer og regneark,” udtalte teamet.
Anthropic forklarede, at Sonnet 5.5 ikke udvider det kapabilitetsmæssige område. Derfor blev der især fokuseret på risici såsom at vildlede brugere og hjælpe med anvendelse i kritiske situationer.
Sonnet 5.5 kommer også med cybersikkerhedsforanstaltninger og anti-destillationsklassificeringer, der blokerer forsøg på at udtrække modellens ræsonnement til træning af konkurrerende systemer. Claude Haiku 5.5 udgives i de kommende uger.
I mellemtiden aflyste OpenAI en kommende model, GPT-6.1 Astra, af sikkerhedsmæssige årsager. I mandags bekræftede CNBC, at modellen ikke levede op til virksomhedens standarder.
Artificial Analysis finder dyrere tokenforbrug ved maks. ydelse
Artificial Analysis, benchmarking-firmaet der placerede Grok 4.7 som nummer fire, gav Sonnet 5.5 en score på 56 på deres Intelligence Index. Det placerer modellen som nummer to overordnet, kun 2 point bag Opus 5.5 ved maksimal indsats.
Firmaet målte 64% for Sonnet 5.5 på Terminal-Bench 4.0 imod 60% for Opus 5.5 og GPT-6 Astra. Ved tests af vidensarbejde som GDPval-AA fandt man, at Sonnet 5.5 og Opus 5.5 lå omtrent ens.
Firmaet forklarede, at Sonnet 5.5 brugte væsentligt flere tokens for at opnå disse resultater.
“Ved maks. indsats, hvor ydeevnen nærmer sig Opus 5.5’s, brugte Claude Sonnet 5.5 ca. 193.000 output-tokens pr. Intelligence Index-opgave,” skrev posten.
Det forbrug ligger omkring 60% over Opus 5.5 og Sonnet 5 ved maksimal indsats – og cirka 7 gange så højt som GPT-6 Astra’s tal.
Kunder med tidlig adgang, som Anthropic citerede, oplevede dog det modsatte ved andre arbejdsopgaver. Balyasny Asset Management så markant lavere tokenforbrug ved deres opgaver inden for finans.
“På vores private suite af 2.441 finansopgaver inden for Q&A, dataudtræk, analyse og prognoser scorede Claude Sonnet 5.5 bedre end Sonnet 5 og brugte ca. 121.000 tokens pr. svar mod Sonnet 5’s 497.000,” udtalte Joe Poirier, Senior AI Engineer hos Balyasny Asset Management.
Artificial Analysis testede en pre-release-udgave med en fejl i struktureret output, som Anthropic nu har rettet. Firmaet planlægger at genafvikle de relevante test snart.
Tilmeld dig vores YouTube-kanal og få ekspertindsigt direkte fra ledere og journalister









