Teknologi

Anthropics Fable 5.1 skærer cacheomkostningerne med 75% og mere end fordobler agentiske scores

Susan Hill

Anthropic opdaterede Claude den 1. september med Fable 5.1 og sænkede prisen på cached input-tokens fra 1,00 dollar til 0,25 dollar per million – en reduktion på 75 %, der kommer netop som de fleste produktionelle AI-udviklere har opdaget, at kontekst-akkumulering, ikke rå regnekraft, er dér, deres infrastrukturbudgetter faktisk koncentrerer sig. I en live agentisk session kan en enkelt Claude-samtalge rumme hundredtusindvis af tokens i cache, efterhånden som konteksten bygges op over samtalerunder. Til 0,25 dollar per million bliver den akkumulering et bevidst designvalg snarere end et omkostningsloft, som en udvikler må arbejde sig uden om.

Benchmark-resultaterne, der følger med prisændringen, viser præstationsforbedringer, der forstærker den økonomiske sag. På Terminal-Bench-Science 0.1, der måler flertrins videnskabelig ræsonnering, som kræver eksperimentelt design og iterativ analyse, scorede Fable 5.1 52,6 % mod Fable 5’s 24,7 % – mere end en fordobling af det tidligere resultat. AutomationBench forbedredes fra 17,1 % til 31,4 %, og Terminal-Bench 4.0, en bredere evaluering af agentisk kapacitet, steg fra 42,0 % til 55,8 %. CursorBench 3.2.0 landede på 73,4 %. Mønsteret på tværs af alle fire evalueringer er ensartet: Fable 5.1 er ikke marginalt bedre i udkanten, den er væsentligt mere pålidelig på de typer opgaver, der definerer agentisk værdi.

Den kombinerede effekt omskriver regnearkitekturen for at bygge med Claude. En agentisk applikation, der fuldfører en opgave i færre omgange – fordi modellen er mere pålidelig – forbruger færre samlede token-cyklusser på vejen til et succesrigt resultat. Anvend 75 % cache-besparelsen på de tokens, den faktisk bruger, og den effektive omkostningsreduktion pr. opgave i højgenbrugte agentiske arbejdsgange når 45 % eller mere. Anthropic har ikke offentliggjort et enkelt hovedtal for de sammensatte besparelser, men udviklere, der modellerer deres egen token-økonomi, vil nå frem til tal i det leje for konteksttunge arbejdsbyrder.

Fable 5.1 er tilgængelig med øjeblikkelig virkning gennem Anthropics direkte API under modelidentifikatoren claude-fable-5-1 samt gennem Amazon Web Services Bedrock, Google Cloud Platform og Microsoft Azure. Anthropic annoncerede Enterprise Frontier Safeguards som en samtidig kapacitet: kundestyret dataretention, kundestyrede krypteringsnøgler og implementering inden for hver enkelt kundes eksisterende cloud-infrastruktur-lejemål, inkluderet uden ekstra omkostning ud over de underliggende cloud-omkostninger.

Samtidig med den generelle udgivelse introducerede Anthropic Mythos 5.1, en variant af den samme underliggende model, der opererer med, hvad virksomheden beskriver som mere tilladende sikkerhedsforanstaltninger for godkendte organisationer. Adgang er forbeholdt verificerede cybersikkerhedsforskningsinstitutioner og life science-virksomheder. Virksomheden henviste til dokumenterede anvendelser, herunder design af protein-bindere og optimering af biologiske modeller med op til 2,5 gange inferens-gennemstrømningen i forhold til standardudgivelsen. Adgang til Mythos 5.1 er ikke selvbetjent: Anthropic gennemgår ansøgninger individuelt og har ikke offentliggjort størrelsen på den tilmeldte kohorte.

Fable 5.1’s agentiske tal, især på Terminal-Bench-Science, placerer Anthropics offentliggjorte resultater foran OpenAIs senest offentliggjorte tal på sammenlignelige evalueringer. Sammenligninger på tværs af virksomheder medfører metodiske forbehold – leverandører vælger evalueringer, der favoriserer deres modeller, og de specifikke tests, Anthropic fremhævede, blev formodentlig valgt for deres gunstige udfald. Hvad der er sværere at bortforklare, er det interne fordoblingsmønster: Fable 5.1 er ikke den samme model med en prissænkning vedhæftet. Præstationsændringen er stor nok til, at prisfortællingen og præstationsfortællingen ikke kan adskilles.

For udviklere, der ikke i øjeblikket bruger Claude, er cache-prisjusteringen det tal, der er værd at oversætte til deres egen token-økonomi. Enhver AI-leverandør, der ikke nærmer sig 0,25 dollar per million cached tokens, vil nu møde direkte prissammenligningsspørgsmål i enterprise-salgs samtaler. Anthropics cache-pris var allerede lavere end flere konkurrenters før denne reduktion; kløften er blevet større. Præstationsforbedringer er sværere at generalisere på tværs af brugsscenarier, men i segmentet for agentisk og videnskabelig ræsonnering sætter Fable 5.1 et benchmark-niveau, som den næste store udgivelse fra enhver leverandør vil blive målt imod.

Tags: , , , ,

Debat

Der er 0 kommentarer.