Hogar
Un equipo académico pone fin al monopolio de los gigantes tecnológicos con SFT; OpenSeeker-v2 encabeza la clasificación de agentes de búsqueda
En el panorama en constante evolución de los modelos de lenguaje a gran escala (LLM), las capacidades de búsqueda profunda se han convertido en la ventaja decisiva para los agentes inteligentes avanzados. Sin embargo, este ámbito ha estado controlado durante mucho tiempo por gigantes del sector que cuentan con una gran financiación. Los enfoques de desarrollo convencionales suelen depender de procesos que consumen muchos recursos y que abarcan el preentrenamiento, el preentrenamiento continuado (CPT), el ajuste fino supervisado (SFT) y el aprendizaje por refuerzo (RL).
Un equipo de investigadores académicos ha presentado recientemente su último trabajo, OpenSeeker-v2, que cuestiona de raíz esta visión establecida. Según su informe, el entrenamiento con trayectorias de tareas de alta calidad y gran dificultad permite que incluso un enfoque sencillo de ajuste fino supervisado (SFT) genere un agente de búsqueda de primer nivel.

El equipo esbozó tres estrategias clave de optimización para la síntesis de datos: en primer lugar, ampliar el grafo de conocimiento para crear un espacio de exploración más amplio; en segundo lugar, ampliar sustancialmente el repertorio de herramientas para superar los límites funcionales; y, por último, aplicar un filtrado estricto de pasos reducidos para garantizar la calidad y la eficiencia de los datos de entrenamiento.
Los resultados experimentales revelan que OpenSeeker-v2 (con 30 000 millones de parámetros y una arquitectura ReAct), entrenado con tan solo 10 600 puntos de datos, mostró un rendimiento sobresaliente en cuatro pruebas de referencia fundamentales: obtuvo una puntuación del 46,0 % en BrowseComp, del 58,1 % en BrowseComp-ZH, un 34,6 % en «Humanity’s Last Exam» y un 78,0 % en xbench. Estas cifras no solo establecen nuevos récords, sino que también superan ampliamente a los modelos del sector que se basaban en complejas cadenas de procesamiento que combinaban CPT, SFT y RL —como Tongyi DeepResearch—.

Sorprendentemente, se trata del primer agente de búsqueda de vanguardia (SOTA) desarrollado por un equipo íntegramente académico utilizando únicamente SFT, con la misma escala y arquitectura de modelo. El equipo ha publicado ahora en código abierto los pesos del modelo de OpenSeeker-v2. Este avance reduce significativamente las barreras de I+D para los agentes de búsqueda avanzados y ofrece una vía de desarrollo más accesible y ligera tanto para la comunidad académica como para la de código abierto.
Artículo: https://arxiv.org/pdf/2605.04036
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
En el panorama en constante evolución de los modelos de lenguaje a gran escala (LLM), las capacidades de búsqueda profunda se han convertido en la ventaja decisiva para los agentes inteligentes avanzados. Sin embargo, este ámbito ha estado controlado durante mucho tiempo por gigantes del sector que cuentan con una gran financiación. Los enfoques de desarrollo convencionales suelen depender de procesos que consumen muchos recursos y que abarcan el preentrenamiento, el preentrenamiento continuado (CPT), el ajuste fino supervisado (SFT) y el aprendizaje por refuerzo (RL).
Un equipo de investigadores académicos ha presentado recientemente su último trabajo, OpenSeeker-v2, que cuestiona de raíz esta visión establecida. Según su informe, el entrenamiento con trayectorias de tareas de alta calidad y gran dificultad permite que incluso un enfoque sencillo de ajuste fino supervisado (SFT) genere un agente de búsqueda de primer nivel.

El equipo esbozó tres estrategias clave de optimización para la síntesis de datos: en primer lugar, ampliar el grafo de conocimiento para crear un espacio de exploración más amplio; en segundo lugar, ampliar sustancialmente el repertorio de herramientas para superar los límites funcionales; y, por último, aplicar un filtrado estricto de pasos reducidos para garantizar la calidad y la eficiencia de los datos de entrenamiento.
Los resultados experimentales revelan que OpenSeeker-v2 (con 30 000 millones de parámetros y una arquitectura ReAct), entrenado con tan solo 10 600 puntos de datos, mostró un rendimiento sobresaliente en cuatro pruebas de referencia fundamentales: obtuvo una puntuación del 46,0 % en BrowseComp, del 58,1 % en BrowseComp-ZH, un 34,6 % en «Humanity’s Last Exam» y un 78,0 % en xbench. Estas cifras no solo establecen nuevos récords, sino que también superan ampliamente a los modelos del sector que se basaban en complejas cadenas de procesamiento que combinaban CPT, SFT y RL —como Tongyi DeepResearch—.

Sorprendentemente, se trata del primer agente de búsqueda de vanguardia (SOTA) desarrollado por un equipo íntegramente académico utilizando únicamente SFT, con la misma escala y arquitectura de modelo. El equipo ha publicado ahora en código abierto los pesos del modelo de OpenSeeker-v2. Este avance reduce significativamente las barreras de I+D para los agentes de búsqueda avanzados y ofrece una vía de desarrollo más accesible y ligera tanto para la comunidad académica como para la de código abierto.
Artículo: https://arxiv.org/pdf/2605.04036
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











