Meitun LongCat、LoHoSearchをリリース、BrowseCompのスコアが30%を下回る
過去1年間、検索エージェントの能力は主にBrowseCompによって定義されてきました。しかし、このベンチマークはその関連性を失いつつあります——わずか10ヶ月でモデルの性能を30%から90%へと引き上げましたが、その価値は急速に低下しています。7月17日、MeituanのLongCatは、検索エージェント開発における意味のある進捗を再点火するために設計された、より厳格な評価であるLoHoSearchを発表しました。

LoHoSearchの課題は手動で作成されたものではなく、762万のエンティティを含むWikipediaの知識グラフから自動生成されています。機械生成であるため、これらのタスクは人間のアノテーターが一貫して再現できないレベルの検索空間と構造的複雑さに達します。要するに、以前のベンチマークが人間が設計した上限に制限されていたのに対し、LoHoSearchは質問生成を知識グラフに委ねることで、事実上その上限を取り除いています。

結果は顕著です。主要な11モデルの中で、最高スコアはわずか34.74%に達しただけで、次の3つのモデルは15%から16%の間でした。一方、同じモデルたちはBrowseCompでは約90%のスコアを達成しています。このギャップは、現在の検索エージェントの真の限界を浮き彫りにしています。注目すべきは、コンテキスト戦略が逓減効果を示していることです:LoHoSearchにおける最良のコンテキスト手法はスコアをわずか6.8ポイント改善しましたが、BrowseCompでは14ポイント改善しました。これは、この新しいベンチマークの下では、能力のギャップを埋めるためにプロンプトやコンテキストエンジニアリングに依存することが、ほぼ効果的ではないことを示唆しています。
LoHoSearchは11のドメインにまたがる544問で構成され、木構造およびグラフ形式で構造化されており、オープンソース化されています。古いベンチマークが頭打ちになるにつれて、検索エージェントの真の課題は始まったばかりであり、LoHoSearchは間もなく不可欠な評価基準となる可能性があります。
関連記事
MiniMax、GPT-5.5を上回る国内AI大規模モデル「M3」を発表
中国のAI分野は、西語科技(Xiyu Technology)の最新大規模言語モデル「MiniMax M3」の公式リリースにより、大きな技術的飛躍を遂げた。この高度なシステムは、最先端のコーディング能力と、最大100万トークンという超長文コンテキストウィンドウのサポートを融合している。特筆すべきは、画像や動画処理に加えてコンピュータデスクトップとのインタラクションもネイティブにサポートしており、これら3つの重要な機能を統合した中国初のオープンソースモデルとなっている。標準ベンチマークにおける卓越し
インドは発信者IDアプリに対し、スパムデータを通信事業者に共有するよう義務付けている
インドは、発信者IDおよび通話管理アプリケーションがユーザーからのスパム報告を通信事業者に共有することを義務付ける、スパム対策規制を拡大した。この措置により、スパムブロックアプリの主要プロバイダーであるTruecallerは、同政策を「競争阻害的」と見なしている。金曜日、インドの通信規制機関である電信規制庁(TRAI)は、商業的通話に関する規則を更新した。これらの更新により、ユーザーが通話をスパムや迷惑電話としてフラグ付けできる発信者IDおよび通話管理アプリは、通信事業者が運営するブロックチェ
Qwen AIプラットフォーム、GLM-5.3およびDeepSeek-V4-Proの公式リリースによりモデルマトリックスを拡大
Alibaba CloudのQwen AIプラットフォーム(MaaS)は、最近モデルサービスマトリックスを拡大し、智譜のフラッグシップ大規模モデルGLM-5.3とDeepSeek-V4-Proの公式リリースを統合しました。対応するAPIサービスは現在一般公開されており、開発者はこれらのモデル機能を迅速にアクセスして利用することができます。この2つの新たにリリースされたモデルは、プログラミングおよびインテリジェントエージェントのコアアプリケーションシナリオに特化して設計されています。智譜の最新技術
関連特集おすすめ
コメント (0)
0/500
過去1年間、検索エージェントの能力は主にBrowseCompによって定義されてきました。しかし、このベンチマークはその関連性を失いつつあります——わずか10ヶ月でモデルの性能を30%から90%へと引き上げましたが、その価値は急速に低下しています。7月17日、MeituanのLongCatは、検索エージェント開発における意味のある進捗を再点火するために設計された、より厳格な評価であるLoHoSearchを発表しました。

LoHoSearchの課題は手動で作成されたものではなく、762万のエンティティを含むWikipediaの知識グラフから自動生成されています。機械生成であるため、これらのタスクは人間のアノテーターが一貫して再現できないレベルの検索空間と構造的複雑さに達します。要するに、以前のベンチマークが人間が設計した上限に制限されていたのに対し、LoHoSearchは質問生成を知識グラフに委ねることで、事実上その上限を取り除いています。

結果は顕著です。主要な11モデルの中で、最高スコアはわずか34.74%に達しただけで、次の3つのモデルは15%から16%の間でした。一方、同じモデルたちはBrowseCompでは約90%のスコアを達成しています。このギャップは、現在の検索エージェントの真の限界を浮き彫りにしています。注目すべきは、コンテキスト戦略が逓減効果を示していることです:LoHoSearchにおける最良のコンテキスト手法はスコアをわずか6.8ポイント改善しましたが、BrowseCompでは14ポイント改善しました。これは、この新しいベンチマークの下では、能力のギャップを埋めるためにプロンプトやコンテキストエンジニアリングに依存することが、ほぼ効果的ではないことを示唆しています。
LoHoSearchは11のドメインにまたがる544問で構成され、木構造およびグラフ形式で構造化されており、オープンソース化されています。古いベンチマークが頭打ちになるにつれて、検索エージェントの真の課題は始まったばかりであり、LoHoSearchは間もなく不可欠な評価基準となる可能性があります。
MiniMax、GPT-5.5を上回る国内AI大規模モデル「M3」を発表
中国のAI分野は、西語科技(Xiyu Technology)の最新大規模言語モデル「MiniMax M3」の公式リリースにより、大きな技術的飛躍を遂げた。この高度なシステムは、最先端のコーディング能力と、最大100万トークンという超長文コンテキストウィンドウのサポートを融合している。特筆すべきは、画像や動画処理に加えてコンピュータデスクトップとのインタラクションもネイティブにサポートしており、これら3つの重要な機能を統合した中国初のオープンソースモデルとなっている。標準ベンチマークにおける卓越し
インドは発信者IDアプリに対し、スパムデータを通信事業者に共有するよう義務付けている
インドは、発信者IDおよび通話管理アプリケーションがユーザーからのスパム報告を通信事業者に共有することを義務付ける、スパム対策規制を拡大した。この措置により、スパムブロックアプリの主要プロバイダーであるTruecallerは、同政策を「競争阻害的」と見なしている。金曜日、インドの通信規制機関である電信規制庁(TRAI)は、商業的通話に関する規則を更新した。これらの更新により、ユーザーが通話をスパムや迷惑電話としてフラグ付けできる発信者IDおよび通話管理アプリは、通信事業者が運営するブロックチェ
Qwen AIプラットフォーム、GLM-5.3およびDeepSeek-V4-Proの公式リリースによりモデルマトリックスを拡大
Alibaba CloudのQwen AIプラットフォーム(MaaS)は、最近モデルサービスマトリックスを拡大し、智譜のフラッグシップ大規模モデルGLM-5.3とDeepSeek-V4-Proの公式リリースを統合しました。対応するAPIサービスは現在一般公開されており、開発者はこれらのモデル機能を迅速にアクセスして利用することができます。この2つの新たにリリースされたモデルは、プログラミングおよびインテリジェントエージェントのコアアプリケーションシナリオに特化して設計されています。智譜の最新技術





家






