Hogar
CVPR 2026 marca un cambio de paradigma en la inteligencia visual a medida que las mejoras marginales pierden importancia
A lo largo de la última década, la visión artificial ha evolucionado desde la clasificación de ImageNet hasta los modelos de difusión, con el objetivo de permitir que las máquinas «vean el mundo». Sin embargo, a medida que las capacidades perceptivas se acercan a los niveles humanos, los beneficios derivados de las mejoras puras en la precisión se están desvaneciendo. En CVPR 2026, la investigación en inteligencia visual ha dado un giro: la visión ya no es el objetivo final, sino un puente hacia el razonamiento, la toma de decisiones y la interacción.
Más allá del «razonamiento ciego»: enfoques adaptativos e implícitos
Los modelos multimodales se han basado durante mucho tiempo en la «cadena de pensamiento» (CoT) para el razonamiento lógico. Sin embargo, hallazgos recientes sugieren que este razonamiento constante suele ser ineficaz. El marco VideoAuto-R1 introduce el «razonamiento bajo demanda»: responde directamente a consultas perceptivas sencillas y activa el razonamiento solo para la lógica compleja. Este método mantiene un rendimiento óptimo al tiempo que reduce la longitud media de la salida en un factor de 3,3.

El medio de razonamiento también está evolucionando. Anteriormente, los modelos dependían del lenguaje para describir relaciones espaciales, lo que fallaba con rompecabezas o estructuras geométricas. La nueva tendencia implica el razonamiento visual implícito dentro del «espacio latente», eludiendo la conversión lineal de texto para captar mejor las estructuras visuales complejas.
Reconsiderar la evaluación: romper la ilusión de las preguntas de opción múltiple
Las evaluaciones actuales de los modelos de lenguaje visual se basan en gran medida en preguntas de opción múltiple (MCQA), lo que podría llevar a sobreestimar sus capacidades. Las investigaciones indican que los modelos suelen «hacer trampa» mediante la eliminación o el sesgo de las opciones, lo que infla las puntuaciones en unos 20 puntos. Para solucionar esto, el sector está adoptando las «preguntas y respuestas abiertas verificables», que obligan a los modelos a comprender realmente el contenido visual en lugar de aprovechar las pistas de las opciones.
Mientras tanto, los escenarios de evaluación están pasando de imágenes estáticas con un único agente a entornos con múltiples agentes. Los bancos de pruebas como VS-Bench exigen que los modelos no solo comprendan el entorno, sino que también demuestren razonamiento estratégico y toma de decisiones en interacciones complejas, como la colaboración y la competencia. Esto marca la transición de la inteligencia visual de un «comprendedor» pasivo a un «tomador de decisiones» activo.

Mejoras en la infraestructura: modelos de código abierto y datos del mundo real
La comunidad de código abierto está aumentando la transparencia. Modelos como Molmo2 publican no solo los pesos, sino también los datos completos y los procesos de entrenamiento. Estos modelos amplían las capacidades, pasando de imágenes individuales a vídeos, añadiendo características de localización precisas y logrando un salto de la «comprensión» a la «indicación de ubicaciones».
Este progreso está respaldado por una infraestructura de datos exhaustiva. Para la edición de imágenes basada en texto, los conjuntos de datos del mundo real a gran escala, como Pico-Banana-400K, subsanan la brecha causada por la dependencia excesiva de los datos sintéticos. Al permitir la edición en múltiples pasos y la alineación de preferencias, este conjunto de datos proporciona una base sólida para entrenar modelos de edición con un mayor sentido común y lógica.
En resumen, la inteligencia visual está evolucionando desde la percepción aislada hacia una inteligencia integrada que combina percepción, cognición y acción. Este cambio representa algo más que pequeñas mejoras en el rendimiento; se trata de una reconstrucción sistemática de los mecanismos de razonamiento, los paradigmas de evaluación y las cadenas de suministro de datos.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
A lo largo de la última década, la visión artificial ha evolucionado desde la clasificación de ImageNet hasta los modelos de difusión, con el objetivo de permitir que las máquinas «vean el mundo». Sin embargo, a medida que las capacidades perceptivas se acercan a los niveles humanos, los beneficios derivados de las mejoras puras en la precisión se están desvaneciendo. En CVPR 2026, la investigación en inteligencia visual ha dado un giro: la visión ya no es el objetivo final, sino un puente hacia el razonamiento, la toma de decisiones y la interacción.
Más allá del «razonamiento ciego»: enfoques adaptativos e implícitos
Los modelos multimodales se han basado durante mucho tiempo en la «cadena de pensamiento» (CoT) para el razonamiento lógico. Sin embargo, hallazgos recientes sugieren que este razonamiento constante suele ser ineficaz. El marco VideoAuto-R1 introduce el «razonamiento bajo demanda»: responde directamente a consultas perceptivas sencillas y activa el razonamiento solo para la lógica compleja. Este método mantiene un rendimiento óptimo al tiempo que reduce la longitud media de la salida en un factor de 3,3.

El medio de razonamiento también está evolucionando. Anteriormente, los modelos dependían del lenguaje para describir relaciones espaciales, lo que fallaba con rompecabezas o estructuras geométricas. La nueva tendencia implica el razonamiento visual implícito dentro del «espacio latente», eludiendo la conversión lineal de texto para captar mejor las estructuras visuales complejas.
Reconsiderar la evaluación: romper la ilusión de las preguntas de opción múltiple
Las evaluaciones actuales de los modelos de lenguaje visual se basan en gran medida en preguntas de opción múltiple (MCQA), lo que podría llevar a sobreestimar sus capacidades. Las investigaciones indican que los modelos suelen «hacer trampa» mediante la eliminación o el sesgo de las opciones, lo que infla las puntuaciones en unos 20 puntos. Para solucionar esto, el sector está adoptando las «preguntas y respuestas abiertas verificables», que obligan a los modelos a comprender realmente el contenido visual en lugar de aprovechar las pistas de las opciones.
Mientras tanto, los escenarios de evaluación están pasando de imágenes estáticas con un único agente a entornos con múltiples agentes. Los bancos de pruebas como VS-Bench exigen que los modelos no solo comprendan el entorno, sino que también demuestren razonamiento estratégico y toma de decisiones en interacciones complejas, como la colaboración y la competencia. Esto marca la transición de la inteligencia visual de un «comprendedor» pasivo a un «tomador de decisiones» activo.

Mejoras en la infraestructura: modelos de código abierto y datos del mundo real
La comunidad de código abierto está aumentando la transparencia. Modelos como Molmo2 publican no solo los pesos, sino también los datos completos y los procesos de entrenamiento. Estos modelos amplían las capacidades, pasando de imágenes individuales a vídeos, añadiendo características de localización precisas y logrando un salto de la «comprensión» a la «indicación de ubicaciones».
Este progreso está respaldado por una infraestructura de datos exhaustiva. Para la edición de imágenes basada en texto, los conjuntos de datos del mundo real a gran escala, como Pico-Banana-400K, subsanan la brecha causada por la dependencia excesiva de los datos sintéticos. Al permitir la edición en múltiples pasos y la alineación de preferencias, este conjunto de datos proporciona una base sólida para entrenar modelos de edición con un mayor sentido común y lógica.
En resumen, la inteligencia visual está evolucionando desde la percepción aislada hacia una inteligencia integrada que combina percepción, cognición y acción. Este cambio representa algo más que pequeñas mejoras en el rendimiento; se trata de una reconstrucción sistemática de los mecanismos de razonamiento, los paradigmas de evaluación y las cadenas de suministro de datos.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











