DeepSeek lança o V4.1-Flash, multimodal e com cache menor, e desiste de redirecionar o V4-Pro
O modelo de 552 bilhões de parâmetros tem pesos sob licença MIT e substitui o V4-Flash na API. A DeepSeek recuou do plano de desviar as chamadas ao V4-Pro.
A DeepSeek lançou em 10 de setembro de 2026 o DeepSeek-V4.1-Flash, primeiro e menor modelo de uma nova família de arquitetura, com entendimento nativo de imagens. Segundo o anúncio da empresa, é um modelo de mistura de especialistas com 552 bilhões de parâmetros e uma arquitetura que a empresa chama de Causal Encoder–Decoder: 8 bilhões de parâmetros ficam ativos no processamento da entrada e 16 bilhões na geração da saída. Os pesos estão no Hugging Face sob licença MIT, com relatório técnico.
O que muda no modelo
O destaque técnico é o cache KV, a memória que o modelo guarda do contexto durante uma sessão. Comparado à geração anterior, o V4.1-Flash usaria um quarto da memória HBM e um oitavo do armazenamento em SSD. A DeepSeek argumenta que as cobranças por acerto de cache pesam muito no custo de agentes e que a compressão reduz esse gasto. No registro de mudanças da API, a empresa lista resultados como 90,9 no GPQA Diamond, 90,6 no Terminal-Bench 2.1 e 74,2 no DeepSWE v1.1, e diz que o modelo supera o próprio V4-Pro em benchmarks. São números da fabricante, medidos com sua própria configuração.
O que muda para quem usa a API
O novo modelo é chamado pelo nome deepseek-flash. O V4-Flash e o V4-Flash-Vision-Exp foram aposentados, e os nomes deepseek-v4-flash e deepseek-v4-flash-vision-exp passaram a apontar temporariamente para o V4.1-Flash. Quem fixou esses nomes passou a receber respostas de outro modelo sem mudar uma linha de código. Os preços caíram junto com o lançamento, a partir das 4h UTC de 10/9, mantendo o esquema de horário de pico e fora de pico, com tarifa fora de pico de 50% da cheia.
O anúncio original dizia ainda que, a partir das 4h UTC de 14 de setembro, todas as chamadas ao deepseek-v4-pro seriam desviadas para o V4.1-Flash, com cobrança pela tarifa do novo modelo, até a chegada de um V4.1-Pro. A The Latent noticiou o plano no dia do lançamento. A empresa recuou: o registro de mudanças da API afirma agora que, “em resposta à demanda dos usuários”, o V4-Pro continuará disponível depois de 14 de setembro, com a cobrança inalterada, e que novas mudanças serão avisadas.
Por que importa
O caso mostra um risco prático de depender de APIs de modelos: nomes de modelo podem passar a responder com outro modelo, e planos de descontinuação podem mudar em dias. Para quem usa a DeepSeek em produção, vale fixar nomes, monitorar o registro de mudanças e repetir as próprias avaliações após trocas. Para quem roda localmente, os pesos sob MIT e o cache menor tornam o V4.1-Flash candidato a testes. Mas, com 552 bilhões de parâmetros, ele continua sendo um modelo para servidores.
Fontes
- DeepSeek API Docs — DeepSeek-V4.1-Flash: Smarter, Faster, More Efficient (10/09/2026)
- DeepSeek API Docs — Change Log (registro de 2026-09-10) (10/09/2026)
- DeepSeek (Hugging Face) — deepseek-ai/DeepSeek-V4.1-Flash (10/09/2026)
- The Latent — DeepSeek releases V4.1-Flash model as it phases out V4 Pro (10/09/2026)
Imagem destacada: ilustração gerada por computador, sem valor documental.


