Site Local

Portal de notícias de tecnologia

DeepSeek lança o V4.1-Flash, multimodal e com cache menor, e desiste de redirecionar o V4-Pro

O modelo de 552 bilhões de parâmetros tem pesos sob licença MIT e substitui o V4-Flash na API. A DeepSeek recuou do plano de desviar as chamadas ao V4-Pro.

DeepSeek lança o V4.1-Flash, multimodal e com cache menor, e desiste de redirecionar o V4-Pro

A DeepSeek lançou em 10 de setembro de 2026 o DeepSeek-V4.1-Flash, primeiro e menor modelo de uma nova família de arquitetura, com entendimento nativo de imagens. Segundo o anúncio da empresa, é um modelo de mistura de especialistas com 552 bilhões de parâmetros e uma arquitetura que a empresa chama de Causal Encoder–Decoder: 8 bilhões de parâmetros ficam ativos no processamento da entrada e 16 bilhões na geração da saída. Os pesos estão no Hugging Face sob licença MIT, com relatório técnico.

O que muda no modelo

O destaque técnico é o cache KV, a memória que o modelo guarda do contexto durante uma sessão. Comparado à geração anterior, o V4.1-Flash usaria um quarto da memória HBM e um oitavo do armazenamento em SSD. A DeepSeek argumenta que as cobranças por acerto de cache pesam muito no custo de agentes e que a compressão reduz esse gasto. No registro de mudanças da API, a empresa lista resultados como 90,9 no GPQA Diamond, 90,6 no Terminal-Bench 2.1 e 74,2 no DeepSWE v1.1, e diz que o modelo supera o próprio V4-Pro em benchmarks. São números da fabricante, medidos com sua própria configuração.

O que muda para quem usa a API

O novo modelo é chamado pelo nome deepseek-flash. O V4-Flash e o V4-Flash-Vision-Exp foram aposentados, e os nomes deepseek-v4-flash e deepseek-v4-flash-vision-exp passaram a apontar temporariamente para o V4.1-Flash. Quem fixou esses nomes passou a receber respostas de outro modelo sem mudar uma linha de código. Os preços caíram junto com o lançamento, a partir das 4h UTC de 10/9, mantendo o esquema de horário de pico e fora de pico, com tarifa fora de pico de 50% da cheia.

O anúncio original dizia ainda que, a partir das 4h UTC de 14 de setembro, todas as chamadas ao deepseek-v4-pro seriam desviadas para o V4.1-Flash, com cobrança pela tarifa do novo modelo, até a chegada de um V4.1-Pro. A The Latent noticiou o plano no dia do lançamento. A empresa recuou: o registro de mudanças da API afirma agora que, “em resposta à demanda dos usuários”, o V4-Pro continuará disponível depois de 14 de setembro, com a cobrança inalterada, e que novas mudanças serão avisadas.

Por que importa

O caso mostra um risco prático de depender de APIs de modelos: nomes de modelo podem passar a responder com outro modelo, e planos de descontinuação podem mudar em dias. Para quem usa a DeepSeek em produção, vale fixar nomes, monitorar o registro de mudanças e repetir as próprias avaliações após trocas. Para quem roda localmente, os pesos sob MIT e o cache menor tornam o V4.1-Flash candidato a testes. Mas, com 552 bilhões de parâmetros, ele continua sendo um modelo para servidores.

Fontes

Imagem destacada: ilustração gerada por computador, sem valor documental.

Deixe comentário

Seu endereço de e-mail não será publicado. Os campos necessários são marcados com *.

Fique por dentro

As principais notícias de tecnologia, todos os dias

Siga o portal nas redes sociais e acompanhe IA, cibersegurança, cloud, hardware e o mercado de tecnologia em primeira mão.