Hogar
AntGroup presenta Ling-3.0-flash-VL, un modelo grande multimodal nativo de 124 mil millones de parámetros

El equipo de código abierto de Ant ha lanzado oficialmente Ling-3.0-flash-VL, el primer modelo grande multimodal nativo de la serie Bailing. Basado en la arquitectura MoE de Ling-3.0-flash, este modelo cuenta con 124B parámetros totales, con solo 5.5B activados por inferencia. Soporta nativamente entradas de imagen, texto y video dentro de una ventana de contexto de 256K tokens.
Durante el desarrollo, el equipo priorizó mejorar la fiabilidad y eficiencia de los modelos grandes en tareas del mundo real. Abordando las preocupaciones de la industria sobre que añadir capacidades visuales podría degradar la inteligencia textual, los resultados del entrenamiento demostraron lo contrario: el entrenamiento multimodal nativo conjunto no solo amplió los límites de aplicación, sino que también impulsó aún más la inteligencia textual.
Para garantizar una ejecución precisa, Ling-3.0-flash-VL introduce un innovador mecanismo de retroalimentación visual. Al implementar un proceso de bucle cerrado que observa los resultados, los compara con los objetivos, identifica desviaciones y corrige continuamente, el modelo pasa de la generación estática a la autocorrección dinámica, mejorando significativamente la fiabilidad de los resultados.
Además, el modelo conserva la fortaleza central de Ling-3.0-flash como nodo de ejecución eficiente en flujos de trabajo de Agentes. Dentro de los bucles de retroalimentación visual, equilibra perfectamente la calidad de salida y la eficiencia de ejecución, permitiendo que tareas complejas se completen más rápido y a menor costo.
Artículo relacionado
OpenAI pospone la oferta pública inicial (IPO) para 2027 ante un aumento de la valoración hasta los 1,2 billones de dólares
OpenAI, pionera en inteligencia artificial, está actualmente negociando financiación privada con inversores para alcanzar una valoración impactante de 1,2 billones de dólares. Esta cifra representa un salto dramático respecto a la valoración post-din
Microsoft Outlook Classic integrará la IA Copilot para la redacción de correos electrónicos en Windows 10 y 11
Windows Latest informa de que Microsoft tiene la intención de lanzar la actualización de Copilot para la versión clásica de Outlook en Windows 10 y 11 a finales de 2026, con la incorporación de una fu
La IA «Seedance» de Volcano Engine cambia su enfoque de la protección de los derechos de autor a la comercialización de la propiedad intelectual
Yule Capital informa de que Huoshan Engine, de ByteDance, ha invitado a varios titulares de derechos de autor a participar en la prueba beta de su nueva «Plataforma de gestión de derechos de autor bas
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

El equipo de código abierto de Ant ha lanzado oficialmente Ling-3.0-flash-VL, el primer modelo grande multimodal nativo de la serie Bailing. Basado en la arquitectura MoE de Ling-3.0-flash, este modelo cuenta con 124B parámetros totales, con solo 5.5B activados por inferencia. Soporta nativamente entradas de imagen, texto y video dentro de una ventana de contexto de 256K tokens.
Durante el desarrollo, el equipo priorizó mejorar la fiabilidad y eficiencia de los modelos grandes en tareas del mundo real. Abordando las preocupaciones de la industria sobre que añadir capacidades visuales podría degradar la inteligencia textual, los resultados del entrenamiento demostraron lo contrario: el entrenamiento multimodal nativo conjunto no solo amplió los límites de aplicación, sino que también impulsó aún más la inteligencia textual.
Para garantizar una ejecución precisa, Ling-3.0-flash-VL introduce un innovador mecanismo de retroalimentación visual. Al implementar un proceso de bucle cerrado que observa los resultados, los compara con los objetivos, identifica desviaciones y corrige continuamente, el modelo pasa de la generación estática a la autocorrección dinámica, mejorando significativamente la fiabilidad de los resultados.
Además, el modelo conserva la fortaleza central de Ling-3.0-flash como nodo de ejecución eficiente en flujos de trabajo de Agentes. Dentro de los bucles de retroalimentación visual, equilibra perfectamente la calidad de salida y la eficiencia de ejecución, permitiendo que tareas complejas se completen más rápido y a menor costo.
OpenAI pospone la oferta pública inicial (IPO) para 2027 ante un aumento de la valoración hasta los 1,2 billones de dólares
OpenAI, pionera en inteligencia artificial, está actualmente negociando financiación privada con inversores para alcanzar una valoración impactante de 1,2 billones de dólares. Esta cifra representa un salto dramático respecto a la valoración post-din
Microsoft Outlook Classic integrará la IA Copilot para la redacción de correos electrónicos en Windows 10 y 11
Windows Latest informa de que Microsoft tiene la intención de lanzar la actualización de Copilot para la versión clásica de Outlook en Windows 10 y 11 a finales de 2026, con la incorporación de una fu
La IA «Seedance» de Volcano Engine cambia su enfoque de la protección de los derechos de autor a la comercialización de la propiedad intelectual
Yule Capital informa de que Huoshan Engine, de ByteDance, ha invitado a varios titulares de derechos de autor a participar en la prueba beta de su nueva «Plataforma de gestión de derechos de autor bas











