Lar
A DeepSeek apresenta o primeiro modelo multimodal de código aberto desenvolvido para agentes de IA
A DeepSeek lançou o DeepSeek-V4-Flash-Vision-Exp no Hugging Face, marcando a estreia do primeiro modelo multimodal experimental da série V4 sob a Licença MIT. Com 305 bilhões de parâmetros e desenvolvido com base no V4-Flash-0731, esse modelo integra um codificador visual e um Aligner à sua arquitetura linguística central, possibilitando uma compreensão robusta de imagens por meio de treinamento contínuo.

Foco em agentes multimodais, não apenas na descrição de imagens
Diferentemente dos modelos multimodais tradicionais focados na resposta a perguntas visuais, a DeepSeek redefiniu o objetivo da versão Vision: priorizar as capacidades dos agentes multimodais. A documentação oficial destaca que os agentes podem interpretar diretamente entradas visuais — como capturas de tela da web, interfaces de software e gráficos — e executar tarefas por meio da invocação de ferramentas. Essencialmente, esse “olho” foi projetado para agentes de máquina, e não para usuários humanos.
O pacote de código aberto é abrangente, apresentando pesos de modelo, Tokenizer, implementações de referência para codificação de prompts e uma configuração mínima de inferência no PyTorch. Ele abrange módulos essenciais, incluindo o codificador visual, Aligner, DFlash Attention, MoE e Hyper-Connections. A comunidade respondeu rapidamente, com sete versões quantizadas já disponíveis no Hugging Face para llama.cpp, LM Studio e Ollama.
Detalhes importantes da linha do tempo revelam um lançamento estratégico: o modelo apareceu pela primeira vez na API do DeepSeek em 21 de agosto, acessível apenas via API, sem distribuição de pesos. Os desenvolvedores podiam inserir texto e imagens simultaneamente, com o processamento de imagens cobrado por token. Dez dias depois, os pesos foram oficialmente divulgados, possibilitando a implantação local e o desenvolvimento secundário. Essa estratégia de “primeiro a API, depois o código aberto” ressalta o posicionamento principal do DeepSeek como provedor de serviços de API.

Desempenho próximo ao do Claude Opus 4.8, com alegações oficiais comprovadas
Os resultados dos benchmarks indicam que a adição de recursos visuais não compromete significativamente o desempenho do agente de texto puro: as pontuações no Terminal Bench 2.1 subiram de 82,7 para 83,9, e o DeepSWE melhorou de 54,4 para 59,3, superando os 58,0 do Opus 4.8. As melhorias nos agentes multimodais são mais pronunciadas: o ApexBench Pass@1 atingiu 36,5, o “Agents’ Last Exam” obteve 27,3 (superando os 25,7 do Opus 4.8) e o ZeroBench Pass@5 atingiu 35,0, superando os 34,0 do concorrente.
No entanto, o DeepSeek evita afirmar “superioridade abrangente”: no projeto NL2Repo, obteve 57,7, ficando atrás dos 69,7 do Opus 4.8. A declaração oficial permanece cautelosa, observando apenas que “as capacidades do agente multimodal estão próximas às do Claude Opus 4.8”. Atualizações recentes mostram que o DeepSeek está montando uma pilha completa de tecnologia de agentes: o modelo lida com raciocínio e chamadas de ferramentas, o Harness gerencia a execução contínua de tarefas e o Vision permite que os agentes interpretem diretamente informações visuais do computador. Este lançamento de código aberto é um passo fundamental para a conclusão desse ecossistema.
Artigo relacionado
Órgãos de saúde dos EUA avaliam modelos de IA da OpenAI e da Anthropic
Órgãos de saúde pública em todo o país devem avaliar a IA generativa por meio de uma nova iniciativa liderada pela Coalizão para a IA na Saúde (Coalition for Health AI), em parceria com a OpenAI, a An
O “Touch and Pay” do Alipay transformará 30 milhões de pontos de contato físicos em uma rede de negócios impulsionada por IA
Após o lançamento de um sistema de pagamentos com IA full-stack e do assistente “Abao” do Alipay, alimentado por IA, o Alipay anunciou, em 8 de julho, que sua solução “Touch and Pay” passou por uma at
Tealium: Por que a qualidade do RAG depende de dados em tempo real
Freddy Berlanti, gerente principal de produtos de IA aplicada da Tealium, explora a geração aumentada por recuperação (RAG). Imagem: Getty ImagesFreddy Berlanti, gerente principal de produto de IA Apl
Recomendações de tópicos especiais relacionados
Comentários (0)
A DeepSeek lançou o DeepSeek-V4-Flash-Vision-Exp no Hugging Face, marcando a estreia do primeiro modelo multimodal experimental da série V4 sob a Licença MIT. Com 305 bilhões de parâmetros e desenvolvido com base no V4-Flash-0731, esse modelo integra um codificador visual e um Aligner à sua arquitetura linguística central, possibilitando uma compreensão robusta de imagens por meio de treinamento contínuo.

Foco em agentes multimodais, não apenas na descrição de imagens
Diferentemente dos modelos multimodais tradicionais focados na resposta a perguntas visuais, a DeepSeek redefiniu o objetivo da versão Vision: priorizar as capacidades dos agentes multimodais. A documentação oficial destaca que os agentes podem interpretar diretamente entradas visuais — como capturas de tela da web, interfaces de software e gráficos — e executar tarefas por meio da invocação de ferramentas. Essencialmente, esse “olho” foi projetado para agentes de máquina, e não para usuários humanos.
O pacote de código aberto é abrangente, apresentando pesos de modelo, Tokenizer, implementações de referência para codificação de prompts e uma configuração mínima de inferência no PyTorch. Ele abrange módulos essenciais, incluindo o codificador visual, Aligner, DFlash Attention, MoE e Hyper-Connections. A comunidade respondeu rapidamente, com sete versões quantizadas já disponíveis no Hugging Face para llama.cpp, LM Studio e Ollama.
Detalhes importantes da linha do tempo revelam um lançamento estratégico: o modelo apareceu pela primeira vez na API do DeepSeek em 21 de agosto, acessível apenas via API, sem distribuição de pesos. Os desenvolvedores podiam inserir texto e imagens simultaneamente, com o processamento de imagens cobrado por token. Dez dias depois, os pesos foram oficialmente divulgados, possibilitando a implantação local e o desenvolvimento secundário. Essa estratégia de “primeiro a API, depois o código aberto” ressalta o posicionamento principal do DeepSeek como provedor de serviços de API.

Desempenho próximo ao do Claude Opus 4.8, com alegações oficiais comprovadas
Os resultados dos benchmarks indicam que a adição de recursos visuais não compromete significativamente o desempenho do agente de texto puro: as pontuações no Terminal Bench 2.1 subiram de 82,7 para 83,9, e o DeepSWE melhorou de 54,4 para 59,3, superando os 58,0 do Opus 4.8. As melhorias nos agentes multimodais são mais pronunciadas: o ApexBench Pass@1 atingiu 36,5, o “Agents’ Last Exam” obteve 27,3 (superando os 25,7 do Opus 4.8) e o ZeroBench Pass@5 atingiu 35,0, superando os 34,0 do concorrente.
No entanto, o DeepSeek evita afirmar “superioridade abrangente”: no projeto NL2Repo, obteve 57,7, ficando atrás dos 69,7 do Opus 4.8. A declaração oficial permanece cautelosa, observando apenas que “as capacidades do agente multimodal estão próximas às do Claude Opus 4.8”. Atualizações recentes mostram que o DeepSeek está montando uma pilha completa de tecnologia de agentes: o modelo lida com raciocínio e chamadas de ferramentas, o Harness gerencia a execução contínua de tarefas e o Vision permite que os agentes interpretem diretamente informações visuais do computador. Este lançamento de código aberto é um passo fundamental para a conclusão desse ecossistema.
Órgãos de saúde dos EUA avaliam modelos de IA da OpenAI e da Anthropic
Órgãos de saúde pública em todo o país devem avaliar a IA generativa por meio de uma nova iniciativa liderada pela Coalizão para a IA na Saúde (Coalition for Health AI), em parceria com a OpenAI, a An
O “Touch and Pay” do Alipay transformará 30 milhões de pontos de contato físicos em uma rede de negócios impulsionada por IA
Após o lançamento de um sistema de pagamentos com IA full-stack e do assistente “Abao” do Alipay, alimentado por IA, o Alipay anunciou, em 8 de julho, que sua solução “Touch and Pay” passou por uma at
Tealium: Por que a qualidade do RAG depende de dados em tempo real
Freddy Berlanti, gerente principal de produtos de IA aplicada da Tealium, explora a geração aumentada por recuperação (RAG). Imagem: Getty ImagesFreddy Berlanti, gerente principal de produto de IA Apl











