Lar
DeepSeek V4.1 Flash é lançado com visão multimodal nativa, superando a versão Pro à medida que os preços caem
O DeepSeek lançou oficialmente hoje o menor modelo de sua mais recente série de arquiteturas: o DeepSeek V4.1Flash. Projetado como um modelo leve com compreensão visual multimodal nativa, ele visa oferecer maior desempenho, inferência mais rápida, maior capacidade de processamento e escalabilidade para tamanhos de parâmetros maiores.
Em seu núcleo, o DeepSeek V4.1Flash utiliza uma arquitetura de Mistura de Especialistas (MoE) com 552 bilhões de parâmetros, apresentando uma estrutura inovadora de Codificador-Decodificador Causal. Seu design assimétrico resulta em apenas 8 bilhões de ativações de entrada e 16 bilhões de ativações de saída, reduzindo significativamente os custos em comparação com modelos de tamanho semelhante. Aprimorado por uma nova abordagem de pré-treinamento e aprendizado por reforço em larga escala, este modelo supera modelos de ponta como o DeepSeek V4Pro em várias avaliações.

No que diz respeito à eficiência e ao controle de custos, o novo modelo reduz drasticamente o tamanho do Cache KV. Em comparação com seu antecessor, o V4.1Flash requer apenas 1/4 da memória de alta largura de banda (HBM) e 1/8 da capacidade de unidade de estado sólido (SSD). Essa compressão é particularmente benéfica para cenários de Agentes, onde os custos de armazenamento de contexto e de acerto de cache são elevados, reduzindo significativamente as despesas operacionais. As estatísticas mostram que o Cache KV encolheu para 1/437 do tamanho do modelo inicial.
Com o lançamento do novo modelo, o DeepSeek atualizou sua linha de produtos e sua estratégia de cobrança. O DeepSeek V4.1Flash agora está disponível por meio da API do DeepSeek sob o nome de modelo deepseek-flash. As versões anteriores, V4Flash e V4Flash Vision Exp, foram descontinuadas, com os nomes antigos (deepseek-v4-flash e deepseek-v4-flash-vision-exp) sendo redirecionados temporariamente para o V4.1Flash. Como o V4.1Flash supera o V4Pro em desempenho, custo, velocidade e tempo de uso, a empresa planeja descontinuar o V4Pro: após as 12h00 de 14 de setembro de 2026, as solicitações para deepseek-v4-pro serão roteadas para o V4.1Flash e cobradas conforme sua tarifa. Parceiros oficiais como WorkBuddy, CodeBuddy e o OpenCode da Tencent já integraram este modelo.
Artigo relacionado
As 1% das melhores empresas gastam US$ 7.500 mensais por funcionário em IA, à medida que os custos de computação se aproximam dos gastos com mão de obra
Atualização de 10 de junho: Um novo relatório do Índice Ramp AI revela que a adoção corporativa de inteligência artificial nos Estados Unidos está se acelerando. As empresas líderes, categorizadas como o topo 1% dos "usuários avançados de IA", estão
Plataforma Aberta Qwen da Alibaba Cloud é Lançada, Habilitando IA em Celulares, Computadores e Óculos em Aluguel, Envio e Muito Mais
À medida que as aplicações de IA se expandem rapidamente, o Qwen atualizou significativamente o seu ecossistema. Lançado em 10 de agosto, a Plataforma Aberta Qwen agora oferece amplo acesso para smartphones, computadores pessoais e óculos de IA a par
Dou Bao previsto para lançar planos pagos em meados de junho, com foco no comércio eletrônico planejado para o terceiro trimestre
O Douyin, principal aplicação de modelo grande da ByteDance, está prestes a lançar recursos de conteúdo pago até o final de junho, com atualizações agendadas para a conferência Force. Esta medida marca um grande marco na monetização do maior modelo g
Recomendações de tópicos especiais relacionados
Comentários (0)
O DeepSeek lançou oficialmente hoje o menor modelo de sua mais recente série de arquiteturas: o DeepSeek V4.1Flash. Projetado como um modelo leve com compreensão visual multimodal nativa, ele visa oferecer maior desempenho, inferência mais rápida, maior capacidade de processamento e escalabilidade para tamanhos de parâmetros maiores.
Em seu núcleo, o DeepSeek V4.1Flash utiliza uma arquitetura de Mistura de Especialistas (MoE) com 552 bilhões de parâmetros, apresentando uma estrutura inovadora de Codificador-Decodificador Causal. Seu design assimétrico resulta em apenas 8 bilhões de ativações de entrada e 16 bilhões de ativações de saída, reduzindo significativamente os custos em comparação com modelos de tamanho semelhante. Aprimorado por uma nova abordagem de pré-treinamento e aprendizado por reforço em larga escala, este modelo supera modelos de ponta como o DeepSeek V4Pro em várias avaliações.

No que diz respeito à eficiência e ao controle de custos, o novo modelo reduz drasticamente o tamanho do Cache KV. Em comparação com seu antecessor, o V4.1Flash requer apenas 1/4 da memória de alta largura de banda (HBM) e 1/8 da capacidade de unidade de estado sólido (SSD). Essa compressão é particularmente benéfica para cenários de Agentes, onde os custos de armazenamento de contexto e de acerto de cache são elevados, reduzindo significativamente as despesas operacionais. As estatísticas mostram que o Cache KV encolheu para 1/437 do tamanho do modelo inicial.
Com o lançamento do novo modelo, o DeepSeek atualizou sua linha de produtos e sua estratégia de cobrança. O DeepSeek V4.1Flash agora está disponível por meio da API do DeepSeek sob o nome de modelo deepseek-flash. As versões anteriores, V4Flash e V4Flash Vision Exp, foram descontinuadas, com os nomes antigos (deepseek-v4-flash e deepseek-v4-flash-vision-exp) sendo redirecionados temporariamente para o V4.1Flash. Como o V4.1Flash supera o V4Pro em desempenho, custo, velocidade e tempo de uso, a empresa planeja descontinuar o V4Pro: após as 12h00 de 14 de setembro de 2026, as solicitações para deepseek-v4-pro serão roteadas para o V4.1Flash e cobradas conforme sua tarifa. Parceiros oficiais como WorkBuddy, CodeBuddy e o OpenCode da Tencent já integraram este modelo.
As 1% das melhores empresas gastam US$ 7.500 mensais por funcionário em IA, à medida que os custos de computação se aproximam dos gastos com mão de obra
Atualização de 10 de junho: Um novo relatório do Índice Ramp AI revela que a adoção corporativa de inteligência artificial nos Estados Unidos está se acelerando. As empresas líderes, categorizadas como o topo 1% dos "usuários avançados de IA", estão
Plataforma Aberta Qwen da Alibaba Cloud é Lançada, Habilitando IA em Celulares, Computadores e Óculos em Aluguel, Envio e Muito Mais
À medida que as aplicações de IA se expandem rapidamente, o Qwen atualizou significativamente o seu ecossistema. Lançado em 10 de agosto, a Plataforma Aberta Qwen agora oferece amplo acesso para smartphones, computadores pessoais e óculos de IA a par
Dou Bao previsto para lançar planos pagos em meados de junho, com foco no comércio eletrônico planejado para o terceiro trimestre
O Douyin, principal aplicação de modelo grande da ByteDance, está prestes a lançar recursos de conteúdo pago até o final de junho, com atualizações agendadas para a conferência Force. Esta medida marca um grande marco na monetização do maior modelo g











