Teknologi

DeepSeek V4.1 Flash: 552 mia. parametre, 8 mia. aktive, cache 60% billigere — og matcher Opus 5

Adrian Kessler

DeepSeek V4.1 Flash kører på en ny arkitektur, som virksomheden kalder Causal Encoder-Decoder. De 552 milliarder parametre spænder over en 20-lags encoder og en 20-lags decoder, men kun 8 milliarder aktiveres på input-tokens og 16 milliarder på output. Det gør modellen strukturelt slankere end modeller, der aktiverer større parameterstykker for hver operation – et designvalg, der direkte betaler sig i inferensomkostninger og hukommelseseffektivitet.

Hukommelsesfordelene er specifikke. V4.1 Flash’s KV-cache ligger på 890 bytes per token, omtrent en fjerdedel af V4-Flash. FP4-caching og Compressed Sparse Attention 2 reducerer det vedvarende cache-fodaftryk til en ottendedel af den foregående generation. Cachet input koster nu $0,003 per million tokens i off-peak – en reduktion på 60% i forhold til V4-Flash. Ikke-cachet input faldt 33%, output 11%.

På de benchmarks, som udviklere følger mest, klarer modellen sig godt. DeepSWE v1.1 – den autonome softwareingeniørtest – giver den 74,2, en brøkdel foran Anthropics Opus 5 på 74,0 og over GPT-5.6 Sol på 73,0. GPQA Diamond scorer 90,9. Det tydeligste afstand er Terminal-Bench 3.0: 30,0 mod Opus 5’s 43,3, en reel forskel på opgaver, der kræver længerevarende interaktiv debugging.

Vision er indbygget fra præ-træning. Tidligere opdelte V4 vision i en separat Vision-Exp-variant. V4.1 Flash erstatter begge med en enkelt model bygget omkring DeepSeek-ViT, en formålstrænet encoder, der er udviklet sammen med sprogmodellen fra starten. Det multimodale niveau er væk – alle kald får vision som standard.

Kontekstvinduet er 1 million tokens med output begrænset til 384.000, nok til langformet dokumentanalyse og udvidede agentiske arbejdsgange uden chunking. Eksisterende API-brugere, der bruger de gamle ID’er deepseek-v4-flash og deepseek-v4-flash-vision-exp, bliver allerede dirigeret til V4.1 Flash. Den 14. september skifter DeepSeek V4 Pro-trafik også over – til Flash-priser.

DeepSeek beskrev V4.1 Flash som “den mindste model i vores nye arkitekturfamilie.” En større V4.1 Pro på samme Causal Encoder-Decoder-design antydes. Hvis den fastholder Flashs effektivitetskurve, ville den forlænge denne arkitekturs ydeevne pr. dollar længere op ad benchmarkkurven – ind i territorium, der i øjeblikket er besat af modeller, der koster betydeligt mere per million tokens.

Det arkitektoniske punkt betyder noget ud over prissætningen. KV-cachevækst er en primær begrænsning for at køre store modeller med lang kontekst, og den skalerer med hvert token, der behandles. V4.1 Flash’s tilgang – færre aktive parametre, komprimeret cache – adresserer den begrænsning direkte. Det er en brugbar skabelon til langkontekstimplementeringer, ikke en grænsetilfældeoptimering.

Tags: , , , , ,

Debat

Der er 0 kommentarer.