Hogar
Tencent presenta OpenSearch-VL: un agente de búsqueda profunda multimodal de código abierto
A medida que los modelos de lenguaje multimodales a gran escala (MLLM) avanzan rápidamente, el principal reto en el ámbito de la IA está pasando de la mera «comprensión pasiva de imágenes» a la búsqueda activa de pruebas y al razonamiento. Sin embargo, la falta de datos de entrenamiento de alta calidad, de procesos automatizados de síntesis de trayectorias y de protocolos de entrenamiento detallados ha dificultado que la comunidad de código abierto pueda replicar los agentes de búsqueda multimodal de primer nivel.
Para superar este cuello de botella, un equipo de investigación de Tencent Hunyuan, junto con la UCLA y la Universidad China de Hong Kong, ha lanzado OpenSearch-VL. Este proyecto, totalmente de código abierto, ofrece una vía para crear un agente de búsqueda profunda de última generación mediante el aprendizaje por refuerzo (RL).

Un innovador proceso de datos supera los atajos en la búsqueda
El equipo identificó los datos de entrenamiento de alta calidad como el principal cuello de botella para el avance de los modelos. Para entrenar modelos capaces de realizar razonamientos de varios pasos —más allá del simple reconocimiento de imágenes con un solo clic—, diseñaron un meticuloso proceso de consolidación de datos.
Este proceso toma muestras de rutas del grafo de hipervínculos de Wikipedia, convirtiendo las complejas relaciones entre entidades en pares de preguntas y respuestas de múltiples saltos. Para evitar el aprendizaje por atajos, los investigadores aplicaron una reescritura difusa de entidades para ocultar las respuestas directas e integraron una localización visual anclada al código fuente. Este enfoque obliga al modelo a detectar primero las señales visuales y, a continuación, a recuperar información de forma iterativa utilizando herramientas externas, lo que evita la degradación de la capacidad durante la recuperación. Como resultado, el equipo creó la base de datos SearchVL-SFT (36 000 trayectorias de ajuste fino mediante instrucciones) y la base de datos SearchVL-RL (8 000 trayectorias de aprendizaje por refuerzo).
Un conjunto de herramientas versátil que va más allá de la simple búsqueda
OpenSearch-VL va más allá de la búsqueda básica de texto. En la práctica, las imágenes proporcionadas por los usuarios suelen estar borrosas, distorsionadas o tener baja resolución, lo que hace que las herramientas de búsqueda convencionales resulten ineficaces.
Para hacer frente a esto, el proyecto incorpora un amplio conjunto de herramientas: búsqueda en la web, búsqueda inversa de imágenes, OCR, recorte de imágenes, mejora de nitidez, superresolución y corrección de perspectiva. El agente percibe y corrige activamente los elementos visuales imperfectos —al igual que lo haría un ser humano— antes de consultar fuentes de conocimiento externas, lo que garantiza la fiabilidad de las búsquedas posteriores.
El algoritmo sensible a los errores permite aprender de los fallos
En tareas de largo plazo, las llamadas a herramientas pueden provocar fallos en cadena. Un solo tiempo de espera agotado o un error pueden hacer fracasar toda la tarea. El aprendizaje por refuerzo (RL) tradicional suele descartar estas trayectorias fallidas, desperdiciando recursos de entrenamiento.
OpenSearch-VL introduce el GRPO multironda sensible a fallos, un algoritmo de entrenamiento que identifica puntos críticos de fallo en las llamadas a herramientas. Utiliza el enmascaramiento para filtrar la información inválida posterior al fallo y aplica un recorte de ventaja unilateral para conservar la lógica útil de los pasos anteriores. De este modo, incluso cuando el resultado final es un fallo, el modelo sigue aprendiendo rutas de búsqueda y estrategias de exploración eficaces a partir de las etapas anteriores.
Los resultados experimentales rivalizan con los modelos comerciales propietarios
Los resultados de la evaluación demuestran un sólido rendimiento en siete pruebas de referencia principales de búsqueda profunda multimodal, con una mejora media que supera los 10 puntos porcentuales. En determinadas tareas específicas, OpenSearch-VL ya está a la altura de los mejores modelos comerciales de código cerrado.
El equipo tiene previsto publicar en código abierto todos los datos de entrenamiento, el código y los pesos del modelo de OpenSearch-VL, ofreciendo así a los desarrolladores de todo el mundo una base reproducible y mejorable que impulse la investigación sobre agentes multimodales hacia un territorio más profundo.
Artículo: https://arxiv.org/pdf/2605.05185
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
A medida que los modelos de lenguaje multimodales a gran escala (MLLM) avanzan rápidamente, el principal reto en el ámbito de la IA está pasando de la mera «comprensión pasiva de imágenes» a la búsqueda activa de pruebas y al razonamiento. Sin embargo, la falta de datos de entrenamiento de alta calidad, de procesos automatizados de síntesis de trayectorias y de protocolos de entrenamiento detallados ha dificultado que la comunidad de código abierto pueda replicar los agentes de búsqueda multimodal de primer nivel.
Para superar este cuello de botella, un equipo de investigación de Tencent Hunyuan, junto con la UCLA y la Universidad China de Hong Kong, ha lanzado OpenSearch-VL. Este proyecto, totalmente de código abierto, ofrece una vía para crear un agente de búsqueda profunda de última generación mediante el aprendizaje por refuerzo (RL).

Un innovador proceso de datos supera los atajos en la búsqueda
El equipo identificó los datos de entrenamiento de alta calidad como el principal cuello de botella para el avance de los modelos. Para entrenar modelos capaces de realizar razonamientos de varios pasos —más allá del simple reconocimiento de imágenes con un solo clic—, diseñaron un meticuloso proceso de consolidación de datos.
Este proceso toma muestras de rutas del grafo de hipervínculos de Wikipedia, convirtiendo las complejas relaciones entre entidades en pares de preguntas y respuestas de múltiples saltos. Para evitar el aprendizaje por atajos, los investigadores aplicaron una reescritura difusa de entidades para ocultar las respuestas directas e integraron una localización visual anclada al código fuente. Este enfoque obliga al modelo a detectar primero las señales visuales y, a continuación, a recuperar información de forma iterativa utilizando herramientas externas, lo que evita la degradación de la capacidad durante la recuperación. Como resultado, el equipo creó la base de datos SearchVL-SFT (36 000 trayectorias de ajuste fino mediante instrucciones) y la base de datos SearchVL-RL (8 000 trayectorias de aprendizaje por refuerzo).
Un conjunto de herramientas versátil que va más allá de la simple búsqueda
OpenSearch-VL va más allá de la búsqueda básica de texto. En la práctica, las imágenes proporcionadas por los usuarios suelen estar borrosas, distorsionadas o tener baja resolución, lo que hace que las herramientas de búsqueda convencionales resulten ineficaces.
Para hacer frente a esto, el proyecto incorpora un amplio conjunto de herramientas: búsqueda en la web, búsqueda inversa de imágenes, OCR, recorte de imágenes, mejora de nitidez, superresolución y corrección de perspectiva. El agente percibe y corrige activamente los elementos visuales imperfectos —al igual que lo haría un ser humano— antes de consultar fuentes de conocimiento externas, lo que garantiza la fiabilidad de las búsquedas posteriores.
El algoritmo sensible a los errores permite aprender de los fallos
En tareas de largo plazo, las llamadas a herramientas pueden provocar fallos en cadena. Un solo tiempo de espera agotado o un error pueden hacer fracasar toda la tarea. El aprendizaje por refuerzo (RL) tradicional suele descartar estas trayectorias fallidas, desperdiciando recursos de entrenamiento.
OpenSearch-VL introduce el GRPO multironda sensible a fallos, un algoritmo de entrenamiento que identifica puntos críticos de fallo en las llamadas a herramientas. Utiliza el enmascaramiento para filtrar la información inválida posterior al fallo y aplica un recorte de ventaja unilateral para conservar la lógica útil de los pasos anteriores. De este modo, incluso cuando el resultado final es un fallo, el modelo sigue aprendiendo rutas de búsqueda y estrategias de exploración eficaces a partir de las etapas anteriores.
Los resultados experimentales rivalizan con los modelos comerciales propietarios
Los resultados de la evaluación demuestran un sólido rendimiento en siete pruebas de referencia principales de búsqueda profunda multimodal, con una mejora media que supera los 10 puntos porcentuales. En determinadas tareas específicas, OpenSearch-VL ya está a la altura de los mejores modelos comerciales de código cerrado.
El equipo tiene previsto publicar en código abierto todos los datos de entrenamiento, el código y los pesos del modelo de OpenSearch-VL, ofreciendo así a los desarrolladores de todo el mundo una base reproducible y mejorable que impulse la investigación sobre agentes multimodales hacia un territorio más profundo.
Artículo: https://arxiv.org/pdf/2605.05185
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











