Дом
Академическая команда положила конец монополии технологических гигантов с помощью SFT; OpenSeeker-v2 возглавил рейтинг поисковых агентов
В условиях постоянно развивающейся сферы крупных языковых моделей (LLM) возможности глубокого поиска стали решающим преимуществом для передовых интеллектуальных агентов. Однако эта сфера уже давно находится под контролем хорошо финансируемых отраслевых гигантов. Традиционные подходы к разработке, как правило, опираются на ресурсоемкие технологические цепочки, включающие предварительное обучение, продолжение предварительного обучения (CPT), контролируемую донастройку (SFT) и обучение с подкреплением (RL).
Команда научных исследователей недавно представила свою новейшую разработку — OpenSeeker-v2, которая кардинально оспаривает эту устоявшуюся точку зрения. Согласно их отчету, обучение на высококачественных траекториях задач повышенной сложности позволяет даже с помощью простого подхода с контролируемой тонкой настройкой (SFT) создать поискового агента высшего уровня.

Команда обозначила три ключевые стратегии оптимизации синтеза данных: во-первых, увеличение масштаба графа знаний для создания более широкого пространства исследования; во-вторых, существенное расширение набора инструментов для расширения функциональных возможностей; и, наконец, применение строгой фильтрации с низким количеством шагов для обеспечения качества и эффективности обучающих данных.
Результаты экспериментов показывают, что OpenSeeker-v2 (с 30 млрд параметров и архитектурой ReAct), обученный всего на 10 600 точках данных, продемонстрировал впечатляющую производительность по четырём основным тестам: он набрал 46,0 % в BrowseComp, 58,1 % в BrowseComp-ZH, 34,6 % в тесте «Humanity’s Last Exam» и 78,0 % в xbench. Эти показатели не только установили новые рекорды, но и всесторонне превзошли отраслевые модели, основанные на сложных конвейерах, сочетающих CPT, SFT и RL, такие как Tongyi DeepResearch.

Примечательно, что это первый передовой (SOTA) поисковый агент, разработанный исключительно академической командой с использованием только SFT при том же масштабе и архитектуре модели. В настоящее время команда опубликовала веса модели OpenSeeker-v2 в открытом доступе. Этот прорыв значительно снижает барьеры для исследований и разработок в области передовых поисковых агентов и предлагает более доступный и облегчённый путь разработки как для академического сообщества, так и для сообщества открытого программного обеспечения.
Статья: https://arxiv.org/pdf/2605.04036
Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль
Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
Комментарии (0)
В условиях постоянно развивающейся сферы крупных языковых моделей (LLM) возможности глубокого поиска стали решающим преимуществом для передовых интеллектуальных агентов. Однако эта сфера уже давно находится под контролем хорошо финансируемых отраслевых гигантов. Традиционные подходы к разработке, как правило, опираются на ресурсоемкие технологические цепочки, включающие предварительное обучение, продолжение предварительного обучения (CPT), контролируемую донастройку (SFT) и обучение с подкреплением (RL).
Команда научных исследователей недавно представила свою новейшую разработку — OpenSeeker-v2, которая кардинально оспаривает эту устоявшуюся точку зрения. Согласно их отчету, обучение на высококачественных траекториях задач повышенной сложности позволяет даже с помощью простого подхода с контролируемой тонкой настройкой (SFT) создать поискового агента высшего уровня.

Команда обозначила три ключевые стратегии оптимизации синтеза данных: во-первых, увеличение масштаба графа знаний для создания более широкого пространства исследования; во-вторых, существенное расширение набора инструментов для расширения функциональных возможностей; и, наконец, применение строгой фильтрации с низким количеством шагов для обеспечения качества и эффективности обучающих данных.
Результаты экспериментов показывают, что OpenSeeker-v2 (с 30 млрд параметров и архитектурой ReAct), обученный всего на 10 600 точках данных, продемонстрировал впечатляющую производительность по четырём основным тестам: он набрал 46,0 % в BrowseComp, 58,1 % в BrowseComp-ZH, 34,6 % в тесте «Humanity’s Last Exam» и 78,0 % в xbench. Эти показатели не только установили новые рекорды, но и всесторонне превзошли отраслевые модели, основанные на сложных конвейерах, сочетающих CPT, SFT и RL, такие как Tongyi DeepResearch.

Примечательно, что это первый передовой (SOTA) поисковый агент, разработанный исключительно академической командой с использованием только SFT при том же масштабе и архитектуре модели. В настоящее время команда опубликовала веса модели OpenSeeker-v2 в открытом доступе. Этот прорыв значительно снижает барьеры для исследований и разработок в области передовых поисковых агентов и предлагает более доступный и облегчённый путь разработки как для академического сообщества, так и для сообщества открытого программного обеспечения.
Статья: https://arxiv.org/pdf/2605.04036
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства











