Zuckerbergs muse-kode taber til Anthropic på Metas egne benchmark-grafer

  • Zuckerberg lancerede Muse Code, og Metas egne diagrammer placerer Claude Opus 5 først.
  • Meta udelod OpenAI’s største kode-model fra sine benchmark-sammenligninger.
  • Uafhængig test viser, at den reelle leder scorer 89,5 %, højere end alle Meta-tal.

Mark Zuckerberg lancerede Muse Code i beta i onsdags, Metas første kunstig intelligens (AI) kodeagent. Anthropics Claude Opus 5 slår den i alle fire sammenligninger, som Meta offentliggjorde ved lanceringen.

Meta udsendte alligevel disse grafer. Virksomheden sælger et billigere værktøj frem for et bedre. Uafhængige testdata tyder på, at forskellen er større, end Meta viste.

Følg os på X for at få de seneste krypto nyheder, mens det sker

Metas egne grafer giver Anthropic sejren hver gang

Muse Spark 1.2 er modellen bag Muse Code. Den fik 82,9% på Terminal-Bench 2.1.

Claude Opus 5 opnåede 86,7% på samme test. Terminal-Bench kommer fra Laude Instituttet og Stanford-forskere. Den indeholder 89 reelle opgaver som systemreparation, dataarbejde og sikkerhed.

Andenpladsen er respektabel. Muse Code slog OpenAI’s Codex med 81,8% og Grok Build med 81,6%.

Benchmark-sammenligningsgraf for Muse Spark 1.2
Benchmark-sammenligningsgraf for Muse Spark 1.2, Kilde: Zuckerberg

Næste graf var hårdere. DeepSWE 1.1 sætter 113 kodeopgaver med adgang til internettet slået fra under bedømmelsen. Muse Spark 1.2 faldt til tredjepladsen med 59,3%.

Meta udgav så en test, de selv havde lavet, baseret på 440 rigtige pull requests fra egne ingeniører. Muse Spark 1.2 fik 70,6% der, omkring ni point efter Opus 5.

Muse Spark 1.2 kørte en kerneoptimeringsopgave i 24 timer på NVIDIA Hopper – mere end 1.000 værktøjskald – og blev ved med at finde reelle hastighedsforbedringer længe efter den indledende udforskningsfase.
Muse Spark 1.2 kørte en kerneoptimeringsopgave i 24 timer på NVIDIA Hopper – mere end 1.000 værktøjskald – og blev ved med at finde reelle hastighedsforbedringer længe efter den indledende udforskningsfase.

Scoren ligger kun 2,3 point over Muse Spark 1.1, modellen Meta sendte ud i juli.

Modellen, Meta undlod på sine kodegrafer

Meta sammenlignede sig selv med GPT-5.6 Terra. OpenAI sælger en stærkere model kaldet Sol, som Meta udelod på alle tre kodegrafer.

Sol topper den uafhængige Terminal-Bench 2.1 ranking med 89,5%. Opus 5 ligger lige bag med 89,1%.

Begge tal slår Metas egen oplysning for Opus 5 på 86,7%. Meta valgte en svagere version af stærkeste konkurrent og kom alligevel bagud.

Mod Sol, den reelle leder, halter Muse Spark 1.2 hele 6,6 point efter – ikke bare 3,8.

Meta brugte dog Sol ét sted. På en GPU-kerneopgave med over 1.000 værktøjskald forbedrede Sol udgangspunktet med 71,2%. Muse Spark 1.2 klarede 68,7% og blev nummer fire ud af seks.

Én fodnote peger den anden vej. Muse Spark 1.2 står endnu ikke på den offentlige rangliste, hvor kun 26 af i alt 183 modeller er testet. Dens 82,9% er derfor stadig kun Metas eget tal.

“Muse Spark 1.2 er vores næste skridt, mens vi nærmer os frontlinjen med større og mere avancerede modeller på vej,” skrev Zuckerberg i et opslag.

Zuckerberg kan snart hoste modellen, der slår hans egen

Meta er angiveligt i dialog om at leje computerkraft til Anthropic. Aftalen kan ende på 10 milliarder dollars over to år. Dermed vil Metas datacentre hjælpe med at køre de Claude-modeller, Muse Code blev bygget for at udkonkurrere.

Ledelsen bag Muse Code blev dyr. I juni 2025 betalte Zuckerberg 14,3 milliarder dollars for Scale AI og dets stifter Alexandr Wang, der nu styrer Meta Superintelligence Labs.

Kursen er Wangs sidste træk. Priserne matcher juli-lanceringen af Metas første betalte API til $1,25 pr. million input tokens og $4,25 pr. million output tokens.

Et bidragsyder-niveau er mere end 10 gange billigere. Udviklere kvalificerer sig ved at lade Meta træne på deres arbejde. Wang ville ikke oplyse omfanget af udbredelse for Muse Spark-serien.

Metas regnskaber forklarer rabatten. Omsætningen steg 28% til 60,8 milliarder dollars sidste kvartal, men driftsoverskuddet faldt 8% til 18,8 milliarder.

Driftsmarginen endte på 31% mod 43% året før. Meta brugte 31,08 milliarder dollars på anlægsinvesteringer alene dette kvartal – og forudser op til 145 milliarder på året.

Muse Code byder faktisk på teknik, som Claude Code ikke har. Baggrundsagenter holder styr på kontekst i hele sessionen. Underagenter arbejder i adskilte kopier af et repository.

Meta har bygget en solid næstbedste kodeagent og sat kursen lavt. Betaen vil vise, om udviklere bytter nogle procentpoint i nøjagtighed for en regning, der kun er cirka en tiendedel så stor.

Ansvarsfraskrivelse

BeInCrypto er forpligtet til upartisk og gennemsigtig rapportering. Denne nyhedsartikel har til formål at levere nøjagtige og aktuelle oplysninger. Læsere opfordres dog til selv at verificere fakta og rådføre sig med en fagperson, før de træffer beslutninger på baggrund af dette indhold. Bemærk venligst, at vores Vilkår og betingelser, Privatlivspolitik og Ansvarsfraskrivelser er blevet opdateret.