オプション
ニュース
実世界のパフォーマンスのためのAIモデル選択の最適化

実世界のパフォーマンスのためのAIモデル選択の最適化

2025年8月11日
152

企業は、アプリケーションを駆動するAIモデルが実際のシナリオで効果的に機能することを確保する必要があります。これらのシナリオを予測することは難しく、評価を複雑にします。更新されたRewardBench 2ベンチマークは、組織にモデルの実際のパフォーマンスに関するより明確な洞察を提供します。

Allen Institute for AI(Ai2)は、RewardBench 2を導入しました。これは、モデルのパフォーマンスと企業の目標との整合性を包括的に評価するために設計されたRewardBenchベンチマークの改良版です。

Ai2は、推論時の計算や下流のトレーニングを通じて相関を評価する分類タスクでRewardBenchを開発しました。RewardBenchは、報酬モデル(RMs)に焦点を当て、大規模言語モデルの出力を評価し、人間のフィードバックによる強化学習(RHLF)を導くためにスコアまたは「報酬」を割り当てます。

RewardBench 2が登場!私たちは最初の報酬モデル評価ツールから学び、はるかに難しく、下流のRLHFや推論時のスケーリングにより強く相関するものを作りました。pic.twitter.com/NGetvNrOQV

— Ai2 (@allen_ai) 2025年6月2日

Ai2の主任研究者であるNathan Lambertは、VentureBeatに対し、元のRewardBenchは当初は良好に機能したが、進化するモデル環境には更新されたベンチマークが必要だったと語りました。

「報酬モデルがより高度になり、ユースケースが複雑になるにつれ、コミュニティと共に、最初のバージョンが実世界の人間の好みの複雑さを完全に扱えていないことがわかりました」と彼は説明しました。

Lambertは、RewardBench 2が評価の範囲と深さを改善し、多様で挑戦的なプロンプトや、AI出力の人間の判断をよりよく反映する改良された手法を組み込んでいると指摘しました。これには新しい人間のプロンプト、より厳しいスコアリングシステム、追加のドメインが含まれます。

モデル評価のための評価の活用

報酬モデルはモデルパフォーマンスを評価しますが、企業の価値観との整合性が重要です。整合性のない報酬モデルは、幻覚を増幅したり、一般化を減少させたり、微調整や強化学習中に有害な応答を過度に優先する問題を引き起こす可能性があります。

RewardBench 2は、事実性、正確な指示の遵守、数学、安全性、焦点、タイの6つのドメインをカバーしています。

「企業は、ニーズに基づいてRewardBench 2を2つの方法で使用できます。RLHFの場合、トップモデルのベストプラクティスとデータセットをパイプラインに統合する必要があります。報酬モデルにはオンライントレーニングが必要です。推論時のスケーリングやデータフィルタリングの場合、RewardBench 2は相関するパフォーマンスでドメインに最適なモデルを選択するのに役立ちます」とLambertは述べました。

Lambertは、RewardBenchのようなベンチマークを使用することで、ユーザーは一般的なスコアではなく、自分にとって最も関連性の高い優先順位に基づいてモデルを評価できると強調しました。彼は、パフォーマンスは主観的であり、ユーザーのコンテキストや目標に強く関連し、人間の好みはしばしば非常に微妙であると指摘しました。

Ai2は、2024年3月に最初のRewardBenchを立ち上げ、初の報酬モデルベンチマークおよびリーダーボードと呼びました。それ以来、MetaのFAIR reWordBenchやDeepSeekのSelf-Principled Critique Tuningなど、よりスマートでスケーラブルな報酬モデルのための新しい手法が登場しています。

2番目の報酬モデル評価が公開されてとても興奮しています。はるかに難しく、ずっとクリーンで、下流のPPO/BoNサンプリングとよく相関しています。

ハッピー・ヒルクライミング!

@saumyamalik44がプロジェクトを卓越したコミットメントでリードしたことを大いに祝福します。https://t.co/c0b6rHTXY5

— Nathan Lambert (@natolambert) 2025年6月2日

モデルパフォーマンスの洞察

RewardBench 2を使用して、Ai2は既存および新たに訓練されたモデルをテストしました。これには、Gemini、Claude、GPT-4.1、Llama-3.1のバリアントや、Qwen、Skywork、Tuluなどのデータセットやモデルが含まれます。

結果は、より強力な基盤モデルにより、大きな報酬モデルが優れていることを示しました。Llama-3.1 Instructバリアントがベンチマークのトップに立ち、Skyworkデータは焦点と安全性を助け、Tuluは事実性で優れたパフォーマンスを示しました。

Ai2は、RewardBench 2が多ドメインで精度に焦点を当てた報酬モデルの評価を進化させる一方で、主に企業が特定のニーズに最適なモデルを選択する際のガイドとなるべきだと指摘しました。

関連記事
AppleのスマートグラスはWWDC27でデビューする可能性があり、プライバシー保護を強調している AppleのスマートグラスはWWDC27でデビューする可能性があり、プライバシー保護を強調している Bloombergのマーク・ガーマン氏によると、Appleのスマートグラス(コードネームN50)は2027年6月のWWDC27で初公開され、2027年秋に小売店での発売が予定されている。当初は今年後半から2027年初頭にかけての発売が目標だったが、製品のさらなる洗練とプライバシー保護プロトコルの強化を可能にするため、発売時期が延期された。プライバシーはAppleのスマートグラス戦略の中核的な柱である。Metaなどの競合他社をめぐるプライバシー論争から教訓を得て、Appleは堅牢な機能とポリシー
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた 内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた 報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明 OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明 外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
関連特集おすすめ
データ分析 収益ダッシュボード、ファネル分析、および製品指標向けのAI SQLコピロット
収益ダッシュボード、ファネル分析、および製品指標向けのAI SQLコピロット

2026年最新かつ最も優れたAI SQLコピロットが最高評価でランクイン!XIX.AIは、毎週更新される実際の環境でのテストに対応した、強力で革新的なツール群を厳選しています。これらの必見ツールを使えば、正確な収益ダッシュボードの作成や販売プロセスの分析、製品指標の迅速な追跡が可能となり、生産性を大幅に向上させることができます。今すぐチェックして、データに基づいた意思決定に最適なツールを見つけましょう!238文字

9 ツール
xix.ai
作曲 曲のドラフト作成に最適なAIメロディ作成ツール
曲のドラフト作成に最適なAIメロディ作成ツール

2026年最新版 高評価のAIメロディ作成ツールで曲のドラフト作成!XIX.AIは、厳格な実世界テストを経て最高の作成体験を提供する、革新的な強力なコレクションを厳選しました。詳細な無料版と有料版の比較、正確なランキング、そして素晴らしい曲のドラフトを楽に作成し、創造的な生産性を大幅に向上させるためにぜひ試すべきオプションが見つかります。今すぐ探索して、あなたに最適なツールを見つけましょう!

8 ツール
xix.ai
チャットボット 面接練習用のベストなAI会話トレーニングツール
面接練習用のベストなAI会話トレーニングツール

2026年最新版・最高評価のAI会話トレーニングツールが、面接練習に最適です。XIX.AIにてご提供しています!この厳選コレクションには、現実世界での厳格なテストを経て正確なフィードバックを提供する強力なツールが含まれています。無料版と有料版の比較や詳細なランキングをご覧いただき、自信とスキルを高めるための必須オプションをお選びください。今すぐ探索して、面接成功に最適なツールを見つけましょう!

12 ツール
xix.ai
デザインとアート クリエイティブな実験に最適なAIスタイル転送ツール
クリエイティブな実験に最適なAIスタイル転送ツール

2026年版 クリエイティブな実験に最適な、最新・最高評価のAIスタイル転送ツール!XIX.AIは、実地テストと厳格なランキングを通じて卓越した結果をもたらす、強力で画期的な「必試」ツールを厳選しました。これらのトップソリューションは、コンテンツ制作を加速させ、無限の創造的可能性を切り拓くことで、クリエイターの生産性を大幅に向上させます。 今すぐチェックして、あなたにぴったりのツールを見つけ、今日から創作を始めましょう!

9 ツール
xix.ai
漫画制作 ビジュアルストーリーテリングに最適なAI吹き出しツール
ビジュアルストーリーテリングに最適なAI吹き出しツール

2026年版、ビジュアルストーリーテリングに最適な高評価AIダイアログバブルツールがXIX.AIに登場!この厳選コレクションには、クリエイターの生産性を高め、創作上のボトルネックを解消する、画期的な強力ツールが揃っています。 無料版と有料版の比較、実地テストの結果、最新のランキングを確認して、魅力的なビジュアルストーリーを構築するのに最適な、ぜひ試すべきソリューションを見つけましょう。今すぐチェックして、あなたにぴったりのツールを発見してください!

10 ツール
xix.ai
ミーティングアシスタント AI会議要約ツールのトップ選定:決定事項とフォローアップを明確に把握
AI会議要約ツールのトップ選定:決定事項とフォローアップを明確に把握

2026年版:意思決定の追跡を明確にし、フォローアップを容易にする、高評価のAI会議要約ツールベストセレクション。この厳選リストでは、会議メモの自動化、重要なアクション項目の特定、すべてのプロジェクトにわたるチーム連携の効率化を通じて、生産性を劇的に向上させる、強力で画期的なソリューションをご紹介します。 無料版と有料版の比較、実地テストの結果、毎週更新されるランキングを参考に、最適なツールを見つけてください。今すぐチェックして、AIの力を最大限に活用しましょう!

9 ツール
xix.ai
コメント (3)
0/500
JeffreyThomas
JeffreyThomas 2026年3月14日 5:01:22 JST

Como usuario que solo tiene conocimientos básicos, elegir el modelo adecuado es un dolor de cabeza. Este artículo menciona problemas prácticos que son ciertos; a veces, el modelo parece brillar en la prueba, pero en la práctica simplemente falla. Me pregunto si el RewardBench actualizado ayuda a predecir cuándo un modelo se 'descompone' de manera realista. Si las empresas confían demasiado en las métricas, podrían terminar con un fiasco en producción 😅. ¿Habrá herramientas más accesibles para los equipos pequeños?

DonaldGonzález
DonaldGonzález 2025年12月7日 7:30:36 JST

この記事、実運用でのAIモデルの難しさをしっかり分析してますね。特にリアルワールドでの性能評価の課題は興味深い。AI導入が進む中で、本当に役立つモデル選びができる企業が勝ち残るのかも。ユーザー体験を考えると、ベンチマークだけで選ぶのは危険かもしれない... 😅

CarlMartin
CarlMartin 2025年9月17日 15:30:37 JST

C'est intéressant, mais j'aimerais voir plus d'exemples concrets sur comment évaluer la performance des modèles en situation réelle. Parfois les benchmarks ne reflètent pas la complexité du terrain 😅

OR