テンセント、オープンソースのマルチモーダル・ディープサーチエージェント「OpenSearch-VL」を発表
マルチモーダル大規模言語モデル(MLLM)が急速に進化する中、AI競争における重要な課題は、単に「受動的に画像を理解する」ことから、能動的に証拠を探し出し、推論を行うことへと移行しつつある。 しかし、高品質なトレーニングデータ、自動化された軌跡合成パイプライン、詳細なトレーニング手法の欠如により、オープンソースコミュニティがトップクラスのマルチモーダル検索エージェントを再現することは困難でした。
このボトルネックを克服するため、Tencent Hunyuanの研究チームは、UCLAおよび香港中文大学と共同で「OpenSearch-VL」を立ち上げました。この完全オープンソースの青写真は、強化学習(RL)を通じて最先端のディープ検索エージェントを構築するための道筋を示しています。

革新的なデータパイプラインが検索の近道を克服
研究チームは、モデルの進化における主なボトルネックとして、高品質なトレーニングデータの不足を特定しました。単純なワンクリック画像認識を超えた、多段階推論を行うモデルを学習させるため、彼らは綿密なデータ統合パイプラインを設計しました。
このパイプラインは、ウィキペディアのハイパーリンクグラフから経路をサンプリングし、複雑なエンティティ間の関係をマルチホップの質問・回答ペアに変換します。近道学習を防ぐため、研究者らはファジーエンティティ書き換えを適用して直接的な回答を隠蔽し、ソースコードに紐づいた視覚的な位置特定機能を統合しました。 このアプローチにより、モデルはまず視覚的シグナルを検出し、その後外部ツールを使用して反復的に情報を取得するよう強制され、情報取得中のスキルの低下を防ぐことができる。 その結果、チームは SearchVL-SFT データベース(36,000 件の指示による微調整の軌跡)と SearchVL-RL データベース(8,000 件の強化学習の軌跡)を構築しました。
単純な検索を超えた汎用的なツールセット
OpenSearch-VLは、基本的なテキスト検索の枠を超えています。実世界での利用において、ユーザーが提供する画像は、ぼやけていたり、歪んでいたり、解像度が低かったりすることが多く、従来の検索ツールでは効果を発揮できません。
この課題に対処するため、本プロジェクトでは、ウェブ検索、逆画像検索、OCR、画像のトリミング、シャープ化、超解像、遠近補正など、豊富なツールセットを組み込んでいます。エージェントは、外部の知識を照会する前に、人間と同様に不完全な画像を能動的に認識・補正し、その後の検索の信頼性を確保します。
誤りを認識するアルゴリズムが、失敗からの学習を可能にする
長期的なタスクでは、ツールの呼び出しが連鎖的な失敗を引き起こす可能性があります。たった1回のタイムアウトやエラーが、タスク全体を頓挫させる恐れがあります。従来の強化学習(RL)では、こうした失敗した軌跡を破棄することが多く、学習リソースを浪費していました。
OpenSearch-VLでは、ツール呼び出しにおける重大な失敗点を特定する学習アルゴリズム「Multi-round Fault-Aware GRPO」を導入しています。このアルゴリズムは、マスキングを用いて失敗後の無効な情報を除外し、片側アドバンテージクリッピングを適用することで、以前のステップからの有用なロジックを保持します。 これにより、最終的な結果が失敗に終わった場合でも、モデルは先行する段階から効果的な探索経路や探索戦略を学習し続けることができます。
商用プロプライエタリモデルに匹敵する実験結果
評価結果では、7つの主要なマルチモーダル深層検索ベンチマークにおいて優れた性能が示され、平均で10パーセントポイント以上の性能向上が確認されました。特定のタスクにおいては、OpenSearch-VLはすでにトップクラスのクローズドソース商用モデルに匹敵する性能を発揮しています。
研究チームは、OpenSearch-VL のすべてのトレーニングデータ、コード、およびモデル重みを完全にオープンソース化し、世界中の開発者に再現可能かつ改良可能な基盤を提供することで、マルチモーダルエージェントの研究をさらなる深みへと推進する計画です。
関連記事
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
アリババ・スーパーカップ:Qwen3.8-Max、強化されたコーディング機能とオフィスツールを搭載してデビュー
アリババは公式に、2.4兆パラメータを備えた次世代の基盤大規模モデル「Qwen3.8-Max」を発表しました。この重要なAIの進歩は、コーディングや専門的なオフィス業務といった中核領域において大幅なパフォーマンス向上をもたらし、堅牢な技術能力を示しています。権威あるArena大規模モデルランキングにおいて、Qwen3.8-Maxは目覚ましい結果を残し、AnthropicのClaudeシリーズに次ぐ順位で、業界リーダーの仲間入りを果たしました。このマイルストーンは、複雑なタスクの処理における国内
関連特集おすすめ
コメント (0)
0/500
マルチモーダル大規模言語モデル(MLLM)が急速に進化する中、AI競争における重要な課題は、単に「受動的に画像を理解する」ことから、能動的に証拠を探し出し、推論を行うことへと移行しつつある。 しかし、高品質なトレーニングデータ、自動化された軌跡合成パイプライン、詳細なトレーニング手法の欠如により、オープンソースコミュニティがトップクラスのマルチモーダル検索エージェントを再現することは困難でした。
このボトルネックを克服するため、Tencent Hunyuanの研究チームは、UCLAおよび香港中文大学と共同で「OpenSearch-VL」を立ち上げました。この完全オープンソースの青写真は、強化学習(RL)を通じて最先端のディープ検索エージェントを構築するための道筋を示しています。

革新的なデータパイプラインが検索の近道を克服
研究チームは、モデルの進化における主なボトルネックとして、高品質なトレーニングデータの不足を特定しました。単純なワンクリック画像認識を超えた、多段階推論を行うモデルを学習させるため、彼らは綿密なデータ統合パイプラインを設計しました。
このパイプラインは、ウィキペディアのハイパーリンクグラフから経路をサンプリングし、複雑なエンティティ間の関係をマルチホップの質問・回答ペアに変換します。近道学習を防ぐため、研究者らはファジーエンティティ書き換えを適用して直接的な回答を隠蔽し、ソースコードに紐づいた視覚的な位置特定機能を統合しました。 このアプローチにより、モデルはまず視覚的シグナルを検出し、その後外部ツールを使用して反復的に情報を取得するよう強制され、情報取得中のスキルの低下を防ぐことができる。 その結果、チームは SearchVL-SFT データベース(36,000 件の指示による微調整の軌跡)と SearchVL-RL データベース(8,000 件の強化学習の軌跡)を構築しました。
単純な検索を超えた汎用的なツールセット
OpenSearch-VLは、基本的なテキスト検索の枠を超えています。実世界での利用において、ユーザーが提供する画像は、ぼやけていたり、歪んでいたり、解像度が低かったりすることが多く、従来の検索ツールでは効果を発揮できません。
この課題に対処するため、本プロジェクトでは、ウェブ検索、逆画像検索、OCR、画像のトリミング、シャープ化、超解像、遠近補正など、豊富なツールセットを組み込んでいます。エージェントは、外部の知識を照会する前に、人間と同様に不完全な画像を能動的に認識・補正し、その後の検索の信頼性を確保します。
誤りを認識するアルゴリズムが、失敗からの学習を可能にする
長期的なタスクでは、ツールの呼び出しが連鎖的な失敗を引き起こす可能性があります。たった1回のタイムアウトやエラーが、タスク全体を頓挫させる恐れがあります。従来の強化学習(RL)では、こうした失敗した軌跡を破棄することが多く、学習リソースを浪費していました。
OpenSearch-VLでは、ツール呼び出しにおける重大な失敗点を特定する学習アルゴリズム「Multi-round Fault-Aware GRPO」を導入しています。このアルゴリズムは、マスキングを用いて失敗後の無効な情報を除外し、片側アドバンテージクリッピングを適用することで、以前のステップからの有用なロジックを保持します。 これにより、最終的な結果が失敗に終わった場合でも、モデルは先行する段階から効果的な探索経路や探索戦略を学習し続けることができます。
商用プロプライエタリモデルに匹敵する実験結果
評価結果では、7つの主要なマルチモーダル深層検索ベンチマークにおいて優れた性能が示され、平均で10パーセントポイント以上の性能向上が確認されました。特定のタスクにおいては、OpenSearch-VLはすでにトップクラスのクローズドソース商用モデルに匹敵する性能を発揮しています。
研究チームは、OpenSearch-VL のすべてのトレーニングデータ、コード、およびモデル重みを完全にオープンソース化し、世界中の開発者に再現可能かつ改良可能な基盤を提供することで、マルチモーダルエージェントの研究をさらなる深みへと推進する計画です。
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
アリババ・スーパーカップ:Qwen3.8-Max、強化されたコーディング機能とオフィスツールを搭載してデビュー
アリババは公式に、2.4兆パラメータを備えた次世代の基盤大規模モデル「Qwen3.8-Max」を発表しました。この重要なAIの進歩は、コーディングや専門的なオフィス業務といった中核領域において大幅なパフォーマンス向上をもたらし、堅牢な技術能力を示しています。権威あるArena大規模モデルランキングにおいて、Qwen3.8-Maxは目覚ましい結果を残し、AnthropicのClaudeシリーズに次ぐ順位で、業界リーダーの仲間入りを果たしました。このマイルストーンは、複雑なタスクの処理における国内





家






