Teknik

DeepSeek V4.1 Flash: 552 miljarder parametrar, 8 miljarder aktiva, 60% billigare cache — och matchar Opus 5

Adrian Kessler

DeepSeek V4.1 Flash drivs av en ny arkitektur som företaget kallar Causal Encoder-Decoder. Dess 552 miljarder parametrar spänner över 20 lager i en kodare och 20 lager i en avkodare, men endast 8 miljarder aktiveras på indatatokens och 16 miljarder på utdata. Det gör den strukturellt smalare än modeller som aktiverar större parameterdelar för varje operation – ett designval som direkt lönar sig i inferenskostnad och minneseffektivitet.

Minnesvinsterna är specifika. V4.1 Flashs KV-cache ligger på 890 byte per token, ungefär en fjärdedel av V4-Flash. FP4-cachning och Compressed Sparse Attention 2 pressar den beständiga cache-fotavtrycket till en åttondel av föregående generation. Cachad inmatning kostar nu $0,003 per miljon tokens under lågtrafik – ned 60 % från V4-Flash. Icachad inmatning sjönk med 33 %, utdata med 11 %.

I de benchmarks som utvecklare följer mest håller modellen stånd. DeepSWE v1.1 – det autonoma mjukvarutestet – ger den 74,2, något före Anthropics Opus 5 på 74,0 och över GPT-5.6 Sol på 73,0. GPQA Diamond får 90,9. Det gap som sticker ut är Terminal-Bench 3.0: 30,0 mot Opus 5:s 43,3 – en verklig skillnad vid uppgifter som kräver utökad interaktiv felsökning.

Vision är inbyggd från förträning. Tidigare delade V4 upp vision i en separat Vision-Exp-variant. V4.1 Flash ersätter båda med en enda modell byggd kring DeepSeek-ViT, en syftestränad kodare som utvecklats tillsammans med språkmodellen från början. Den multimodala nivån är borta – varje anrop får vision som standard.

Kontextfönstret är 1 miljon tokens med utdatabegränsning på 384 000, tillräckligt för analys av långa dokument och utökade agentiska arbetsflöden utan att behöva dela upp. Befintliga API-anropare som använder de gamla ID:erna deepseek-v4-flash och deepseek-v4-flash-vision-exp dirigeras redan till V4.1 Flash. Den 14 september byter DeepSeek V4 Pro trafik också – till Flash-prissättning.

DeepSeek beskrev V4.1 Flash som ”den minsta modellen i vår nya arkitekturfamilj.” En större V4.1 Pro på samma Causal Encoder-Decoder-design antyds. Om den bibehåller effektivitetsspår från Flash skulle den förlänga denna arkitekturs prestanda-per-dollar ytterligare uppåt i benchmarkkurvan – in på territorium som för närvarande innehas av modeller som kostar betydligt mer per miljon tokens.

Den arkitektoniska poängen är viktig utöver prissättningstabellen. KV-cache-tillväxt är en primär begränsning för att köra stora modeller med lång kontext, och den skalas med varje token som bearbetas. V4.1 Flashs strategi – färre aktiva parametrar, komprimerad cache – adresserar den begränsningen direkt. Den är en användbar mall för långkontextdistributioner, inte en hörnfallsoptimering.

Taggar: , , , , ,

Diskussion

Det finns 0 kommentarer.