Hogar
DeepSeek presenta el primer modelo multimodal de código abierto diseñado para agentes de IA
DeepSeek ha lanzado DeepSeek-V4-Flash-Vision-Exp en Hugging Face, lo que supone el debut del primer modelo multimodal experimental de la serie V4 bajo la licencia MIT. Con 305 mil millones de parámetros y basado en la base V4-Flash-0731, este modelo integra un codificador visual y un «Aligner» en su arquitectura lingüística central, lo que permite una comprensión sólida de las imágenes mediante un entrenamiento continuo.

Enfocado en los agentes multimodales, no solo en la descripción de imágenes
A diferencia de los modelos multimodales tradicionales centrados en la respuesta a preguntas visuales, DeepSeek ha redefinido el propósito de la versión Vision: dar prioridad a las capacidades de los agentes multimodales. La documentación oficial destaca que los agentes pueden interpretar directamente entradas visuales —como capturas de pantalla de la web, interfaces de software y gráficos— y ejecutar tareas mediante la invocación de herramientas. En esencia, este «ojo» está diseñado para agentes automáticos, más que para usuarios humanos.
El paquete de código abierto es muy completo e incluye los pesos del modelo, el tokenizador, implementaciones de referencia de Prompt Encoding y una configuración mínima de inferencia con PyTorch. Abarca módulos esenciales como el codificador visual, Aligner, DFlash Attention, MoE e Hyper-Connections. La comunidad ha respondido con rapidez: ya hay siete versiones cuantificadas disponibles en Hugging Face para llama.cpp, LM Studio y Ollama.
Algunos detalles destacados de la cronología revelan un lanzamiento estratégico: el modelo apareció por primera vez en la API de DeepSeek el 21 de agosto, accesible únicamente a través de la API y sin distribución de pesos. Los desarrolladores podían introducir texto e imágenes simultáneamente, y el procesamiento de imágenes se cobraba por token. Diez días después, se publicaron oficialmente los pesos, lo que permitió la implementación local y el desarrollo secundario. Esta estrategia de «primero la API, luego el código abierto» subraya el posicionamiento principal de DeepSeek como proveedor de servicios de API.

Rendimiento cercano al de Claude Opus 4.8, con afirmaciones oficiales contrastadas
Los resultados de las pruebas de rendimiento indican que añadir capacidades visuales no compromete significativamente el rendimiento del agente de texto puro: las puntuaciones de Terminal Bench 2.1 subieron de 82,7 a 83,9, y DeepSWE mejoró de 54,4 a 59,3, superando los 58,0 de Opus 4.8. Las mejoras de los agentes multimodales son más pronunciadas: ApexBench Pass@1 alcanzó los 36,5, Agents’ Last Exam obtuvo una puntuación de 27,3 (superando los 25,7 de Opus 4.8), y ZeroBench Pass@5 alcanzó los 35,0, superando los 34,0 del competidor.
Sin embargo, DeepSeek evita afirmar una «superioridad general»: en el proyecto NL2Repo, obtuvo una puntuación de 57,7, por detrás de los 69,7 de Opus 4.8. La declaración oficial se mantiene prudente y se limita a señalar que «las capacidades de los agentes multimodales se acercan a las de Claude Opus 4.8». Las últimas actualizaciones muestran que DeepSeek está creando una pila tecnológica completa para agentes: el modelo se encarga del razonamiento y de las llamadas a herramientas, Harness gestiona la ejecución continua de tareas y Vision permite a los agentes interpretar directamente la información visual generada por ordenador. Este lanzamiento de código abierto supone un paso fundamental para completar este ecosistema.
Artículo relacionado
Las agencias sanitarias estadounidenses evalúan los modelos de IA de OpenAI y Anthropic
Las agencias de salud pública de todo el país se disponen a evaluar la IA generativa a través de una nueva iniciativa liderada por la Coalición para la IA en la Salud, en colaboración con OpenAI, Anth
La función «Touch and Pay» de Alipay transformará 30 millones de puntos de contacto físicos en una red empresarial impulsada por la inteligencia artificial
Tras el lanzamiento de un sistema de pago basado íntegramente en IA y del asistente de Alipay impulsado por IA «Abao», Alipay anunció el 8 de julio que su solución «Touch and Pay» ha sido objeto de un
Tealium: Por qué la calidad de RAG depende de los datos en tiempo real
Freddy Berlanti, director de producto de IA aplicada en Tealium, analiza la generación aumentada por recuperación (RAG). Imagen: Getty ImagesFreddy Berlanti, director de producto de IA aplicada en Tea
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
DeepSeek ha lanzado DeepSeek-V4-Flash-Vision-Exp en Hugging Face, lo que supone el debut del primer modelo multimodal experimental de la serie V4 bajo la licencia MIT. Con 305 mil millones de parámetros y basado en la base V4-Flash-0731, este modelo integra un codificador visual y un «Aligner» en su arquitectura lingüística central, lo que permite una comprensión sólida de las imágenes mediante un entrenamiento continuo.

Enfocado en los agentes multimodales, no solo en la descripción de imágenes
A diferencia de los modelos multimodales tradicionales centrados en la respuesta a preguntas visuales, DeepSeek ha redefinido el propósito de la versión Vision: dar prioridad a las capacidades de los agentes multimodales. La documentación oficial destaca que los agentes pueden interpretar directamente entradas visuales —como capturas de pantalla de la web, interfaces de software y gráficos— y ejecutar tareas mediante la invocación de herramientas. En esencia, este «ojo» está diseñado para agentes automáticos, más que para usuarios humanos.
El paquete de código abierto es muy completo e incluye los pesos del modelo, el tokenizador, implementaciones de referencia de Prompt Encoding y una configuración mínima de inferencia con PyTorch. Abarca módulos esenciales como el codificador visual, Aligner, DFlash Attention, MoE e Hyper-Connections. La comunidad ha respondido con rapidez: ya hay siete versiones cuantificadas disponibles en Hugging Face para llama.cpp, LM Studio y Ollama.
Algunos detalles destacados de la cronología revelan un lanzamiento estratégico: el modelo apareció por primera vez en la API de DeepSeek el 21 de agosto, accesible únicamente a través de la API y sin distribución de pesos. Los desarrolladores podían introducir texto e imágenes simultáneamente, y el procesamiento de imágenes se cobraba por token. Diez días después, se publicaron oficialmente los pesos, lo que permitió la implementación local y el desarrollo secundario. Esta estrategia de «primero la API, luego el código abierto» subraya el posicionamiento principal de DeepSeek como proveedor de servicios de API.

Rendimiento cercano al de Claude Opus 4.8, con afirmaciones oficiales contrastadas
Los resultados de las pruebas de rendimiento indican que añadir capacidades visuales no compromete significativamente el rendimiento del agente de texto puro: las puntuaciones de Terminal Bench 2.1 subieron de 82,7 a 83,9, y DeepSWE mejoró de 54,4 a 59,3, superando los 58,0 de Opus 4.8. Las mejoras de los agentes multimodales son más pronunciadas: ApexBench Pass@1 alcanzó los 36,5, Agents’ Last Exam obtuvo una puntuación de 27,3 (superando los 25,7 de Opus 4.8), y ZeroBench Pass@5 alcanzó los 35,0, superando los 34,0 del competidor.
Sin embargo, DeepSeek evita afirmar una «superioridad general»: en el proyecto NL2Repo, obtuvo una puntuación de 57,7, por detrás de los 69,7 de Opus 4.8. La declaración oficial se mantiene prudente y se limita a señalar que «las capacidades de los agentes multimodales se acercan a las de Claude Opus 4.8». Las últimas actualizaciones muestran que DeepSeek está creando una pila tecnológica completa para agentes: el modelo se encarga del razonamiento y de las llamadas a herramientas, Harness gestiona la ejecución continua de tareas y Vision permite a los agentes interpretar directamente la información visual generada por ordenador. Este lanzamiento de código abierto supone un paso fundamental para completar este ecosistema.
Las agencias sanitarias estadounidenses evalúan los modelos de IA de OpenAI y Anthropic
Las agencias de salud pública de todo el país se disponen a evaluar la IA generativa a través de una nueva iniciativa liderada por la Coalición para la IA en la Salud, en colaboración con OpenAI, Anth
La función «Touch and Pay» de Alipay transformará 30 millones de puntos de contacto físicos en una red empresarial impulsada por la inteligencia artificial
Tras el lanzamiento de un sistema de pago basado íntegramente en IA y del asistente de Alipay impulsado por IA «Abao», Alipay anunció el 8 de julio que su solución «Touch and Pay» ha sido objeto de un
Tealium: Por qué la calidad de RAG depende de los datos en tiempo real
Freddy Berlanti, director de producto de IA aplicada en Tealium, analiza la generación aumentada por recuperación (RAG). Imagen: Getty ImagesFreddy Berlanti, director de producto de IA aplicada en Tea











