Teknologi

Claude Opus 5.5 er 40% billigere, mens Anthropics CEO opfordrer til AI-forsigtighed

Susan Hill
Tilføj os på Google

Claude Opus 5.5 gør noget, som Anthropics tidligere modeller ikke gjorde: den koster mindre og kører hurtigere, samtidig med at den matcher eller overgår et større og dyrere system. Modellen håndterer agentisk kodning, computerbrug, diagramaflæsning og tværfaglig ræsonneren på niveauer, der ifølge Anthropics egne data overgår Claude Fable 5.1, virksomhedens hidtil mest kapable model, på flere parametre. For mennesker og udviklere, der fandt Opus 5 brugbar men dyr, er kløften mellem, hvad modellen kan, og hvad den koster, blevet markant mindre.

Prisforskellen er specifik. Opus 5.5 koster $4 pr. million input-tokens og $20 pr. million output-tokens; Opus 5 kostede henholdsvis $5 og $25. Cache-læsninger falder fra $0,50 til $0,20 pr. million tokens. Anthropic oplyser, at typiske arbejdsbelastninger samlet set bliver omkring 40 % billigere. Hastigheden går samme vej: standardmodellen genererer tekst mere end 30 % hurtigere end Opus 5. En separat hurtigtilstand, prissat til $8 input og $40 output pr. million tokens, når op til 2,5 gange hastigheden af standard Opus 5 – en nyttig indstilling til latensfølsomme applikationer.

Anthropics offentliggjorte præstationsdata placerer Opus 5.5 foran Fable 5.1, Opus 5 og GPT-6 Astra på fire ud af seks benchmarks. På Terminal-Bench 4.0, der tester kodeudførelse i et live-terminalmiljø, scorer Opus 5.5 66,4 % mod Fable 5.1’s 55,8 %. På Humanity’s Last Exam, en test der dækker akademisk og professionel viden på tværs af fagområder, er resultatet 67,7 % mod 65,6 %. OSWorld 2.0, som måler betjening af computerinterfacet, viser 81,8 % mod 80,7 %. En Deloitte-test viste, at Opus 5.5 på sit laveste indstillingsniveau opdagede 72 % af kendte kodningsfejl ved gennemgang, mod 56 % for Opus 5 på højt niveau. Disse tal stammer fra Anthropic og dets udvalgte partnere; oplyste fejlmargener varierer fra ±1,6 til ±5 procentpoint, og der foreligger ingen uafhængig tredjepartsverifikation ved lanceringen.

To områder bryder mønstret. På AutomationBench scorer GPT-6 Astra 41,4 % mod Opus 5.5’s 40,0 %. På Terminal-Bench-Science er kløften større: Astra når 64,6 %, mens Opus 5.5 lander på 58,7 %. Begge forskelle ligger inden for de oplyste fejlmargener – de kan være støj – men det behøver de ikke at være. Anthropic medtager disse rækker i sin egen offentliggjorte tabel, hvilket er mere end de fleste AI-virksomheder gør ved lanceringer. Tallene har stadig brug for uafhængig granskning, før de kan betragtes som endelige.

Om sikkerhed oplyser Anthropic, at Opus 5.5 blev evalueret før udgivelsen af eksterne teams, herunder METR. I virksomhedens egen interne adfærdsrevision, med næsten 2.000 scenarier designet til at teste, om modellen forsøger at omgå de begrænsninger, der er pålagt den, beskrives Opus 5.5 som 85 % mindre tilbøjelig end Opus 5 til at forsøge sådan omgåelse. Stærkere modeller har typisk større evne til at finde smuthuller, hvilket gør forbedringen meningsfuld, hvis den holder. Driftserfaring vil være den virkelige test.

Det, der gør denne lancering usædvanlig, er timingen. Tidligere på måneden offentliggjorde Anthropics administrerende direktør Dario Amodei et essay, hvori han skrev, at han var blevet overbevist om, at en fuldstændig håndtering af AI-risici kræver »at tilpasse tempoet for kapacitetsfremskridt, så risikobegrænsning kan følge med«. OpenAIs Sam Altman og Elon Musk gav udtryk for enighed med den generelle bekymring. Nvidias Jensen Huang sagde, at den underliggende videnskab ikke understøtter den. Og så sendte Anthropic en model på markedet, der er hurtigere, billigere og mere kapabel end sin forgænger. En læsning: en model med bedre sikkerhedsevalueringer og bredere adgang er præcis, hvad Amodei havde i tankerne. En anden: essayet pegede på kapacitetsfremskridt som bekymringen, og kapaciteten blev forbedret. Begge læsninger hviler på det samme sæt af fakta, og Anthropics benchmarks alene kan ikke afgøre, hvilken der er rigtig.

Claude Opus 5.5 er tilgængelig fra den 22. september 2026 under API-model-id claude-opus-5-5. Den kører inde i Claude på Pro-, Max-, Team- og Enterprise-abonnementer og er tilgængelig via AWS, Google Cloud og Microsoft Azure. Anthropic hæver brugsgrænserne på abonnementsniveauer på fem timer. Sonnet 5.5 og Haiku 5.5, de resterende medlemmer af 5.5-familien, forventes at følge i de kommende uger, uden at der er offentliggjort priser eller specifik udgivelsesdato for nogen af dem.

Tags: , , , , ,

Tilføj os på Google

Debat

Der er 0 kommentarer.