DeepSeek V4.1-Flash reduz KV cache em 4x com contexto de 1 milhão de tokens
Publicado 10 de set. de 2026 · Leitura 2 min de leitura · Relevância 9.2

Modelo multimodal MIT usa 552 bilhões de parâmetros de backbone, ativa 8 bilhões no prefill e reduz o KV cache persistente para 890 bytes por token.
KV cache é um dos principais limites de memória em inferência de contexto longo. Uma redução de 4x frente à geração anterior pode mudar densidade, custo e latência de agentes, embora o modelo continue exigindo infraestrutura de grande porte.
A DeepSeek publicou o V4.1-Flash, um modelo multimodal Mixture-of-Experts com 552 bilhões de parâmetros de backbone e contexto de até 1 milhão de tokens. A arquitetura ativa 8 bilhões de parâmetros por token no prefill e 16 bilhões na geração.
O principal delta está no custo de memória para contextos longos. A combinação de Causal Encoder-Decoder, atenção esparsa e KV cache em FP4 reduz o cache global persistente para 890 bytes por token, cerca de um quarto do DeepSeek V4-Flash. A DeepSeek disponibilizou pesos e código sob licença MIT, além de instruções para vLLM e SGLang.
Nos testes publicados pela própria equipe, o modelo obteve 74,2% no DeepSWE v1.1, 90,6% no Terminal-Bench 2.1 e 31,2% no Terminal-Bench 4.0 com esforço máximo. Esses números ainda precisam de reprodução independente e variam conforme o scaffold usado.
Para operadores de inferência, a redução de KV cache pode elevar concorrência e reduzir pressão de memória em agentes com prompts longos. O benefício real dependerá do suporte dos runtimes, do hardware usado e do throughput fora do ambiente da DeepSeek.
Acompanhar benchmarks independentes de qualidade e throughput, memória medida em vLLM e SGLang, disponibilidade por API, preço por token e eventuais diferenças entre o desempenho publicado e implantações reais.