选项
首页
新闻
优化AI模型选择以实现现实世界性能

优化AI模型选择以实现现实世界性能

2025-08-11
152

企业必须确保其驱动应用的AI模型在现实世界场景中有效运行。预测这些场景可能具有挑战性,使评估复杂化。更新后的RewardBench 2基准为组织提供了更清晰的模型实际性能洞察。

艾伦人工智能研究所(Ai2)推出了RewardBench 2,这是其RewardBench基准的增强版,旨在全面评估模型性能以及与企业目标的契合度。

Ai2开发了RewardBench,包含分类任务,通过推理时计算和下游训练评估相关性。RewardBench专注于奖励模型(RMs),这些模型通过分配分数或“奖励”来判断大型语言模型输出,以指导基于人类反馈的强化学习(RHLF)。

RewardBench 2来了!我们花了很长时间从首个奖励模型评估工具中学习,打造了一个难度大幅提升、与下游RLHF和推理时扩展更相关的工具。pic.twitter.com/NGetvNrOQV

— Ai2 (@allen_ai) 2025年6月2日

Ai2高级研究科学家Nathan Lambert对VentureBeat表示,最初的RewardBench表现良好,但模型环境的演变要求更新基准。

“随着奖励模型变得更复杂,用例更复杂,我们与社区一起发现,第一版未能完全解决现实世界中人类偏好的复杂性,”他解释道。

Lambert指出,RewardBench 2改进了评估范围和深度,纳入了多样化、具有挑战性的提示和优化方法,以更好地反映人类对AI输出的判断。它包括新的人类提示、更严格的评分系统和额外领域。

利用评估进行模型评估

奖励模型评估模型性能,但与公司价值观的契合至关重要。未对齐的奖励模型可能放大幻觉、降低泛化能力或在微调和强化学习中过度偏向有害响应。

RewardBench 2涵盖六个领域:事实性、精确指令遵循、数学、安全性、专注度和关联性。

“企业可根据需求以两种方式使用RewardBench 2。对于RLHF,应将顶级模型的最佳实践和数据集整合到其流程中,因为奖励模型需要在线训练。对于推理时扩展或数据过滤,RewardBench 2帮助选择与其领域性能相关的最佳模型,”Lambert说。

Lambert强调,像RewardBench这样的基准允许用户根据最相关的优先级评估模型,而非通用分数。他指出,性能是主观的,与用户背景和目标密切相关,人类偏好往往非常微妙。

Ai2于2024年3月推出原始RewardBench,称其为首个奖励模型基准和排行榜。此后,出现了Meta的FAIR reWordBench和DeepSeek的自我原则批判调优等新方法,用于更智能、可扩展的奖励模型。

非常兴奋我们的第二个奖励模型评估发布。它难度大幅提升,更清晰,与下游PPO/BoN采样高度相关。

祝爬坡愉快!

衷心祝贺@saumyamalik44,她以卓越的承诺领导了这个项目。https://t.co/c0b6rHTXY5

— Nathan Lambert (@natolambert) 2025年6月2日

模型性能洞察

通过RewardBench 2,Ai2测试了现有和新训练的模型,包括Gemini、Claude、GPT-4.1和Llama-3.1的变体,以及Qwen、Skywork和Tulu等数据集和模型。

结果显示,较大的奖励模型因更强大的基础模型而表现优异。Llama-3.1 Instruct变体在基准测试中名列前茅,Skywork数据有助于专注度和安全性,Tulu在事实性方面表现良好。

Ai2指出,虽然RewardBench 2推动了多领域、注重准确性的奖励模型评估,但企业应主要用它来选择最适合其特定需求的模型。

相关文章
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。 DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。 Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额 尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额 尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
加利福尼亚州自动驾驶合规:罚单、地理围栏和100万英里的新时代 加利福尼亚州自动驾驶合规:罚单、地理围栏和100万英里的新时代 Guident公司在南佛罗里达州运营一辆AuveTech自动驾驶班车,利用其远程监控技术管理西棕榈滩的一条4英里路线和博卡拉顿的一条1英里路线。| 图片来源:Guident加利福尼亚州正在重新定义无人驾驶车辆的监管格局,正逐渐摆脱科技行业“快速行动,打破常规”的思维模式,转向严格的问责制和严苛的行驶里程要求。Guident执行董事长兼首席执行官哈罗德·布劳恩(Harold Braun)在《机器人报
相关专题推荐
写作 适用于长篇写作的AI文章大纲工具
适用于长篇写作的AI文章大纲工具

2026年最新最佳、评分最高的人工智能文章大纲工具,专为长文写作打造!这份精心挑选的合集收录了功能强大、具有革命性意义的工具,它们能生成准确、结构清晰的大纲,并经过实际测试验证,可显著提升写作效率。XIX.AI 便是这份精英精选中的成员之一。 获取免费版与付费版的对比指南,助您选择最适合的工具。立即探索,释放您的AI优势!

9 个工具
xix.ai
聊天机器人 用于语言练习、面试准备和日常流利度的最佳 AI 角色扮演聊天应用
用于语言练习、面试准备和日常流利度的最佳 AI 角色扮演聊天应用

2026 年最新最佳顶级评分 AI 角色扮演聊天应用,用于语言练习、面试准备和日常流利度!XIX.AI 精心策划了一个强大的变革性合集,提供免费与付费对比、真实世界测试以及每周更新的排名。这些必试工具可帮助您提升写作技能,克服流利度挑战,并提高所有日常场景下的沟通效率。立即探索,发现您语言成长的完美工具!

10 个工具
xix.ai
音乐创作 用于混音制作、采样准备及卡拉OK母带处理的 AI 声部分离工具
用于混音制作、采样准备及卡拉OK母带处理的 AI 声部分离工具

2026年最新、最优秀且评分最高的AI音轨分离工具汇总,专为混音制作、采样准备以及卡拉OK音频处理而设计。这些功能强大的创新工具经过实际测试,能够实现精准的音频分离,显著提升工作效率。XIX.AI每周都会更新免费的付费产品对比指南,帮助您找到最适合自身需求的工具。立即探索,发挥您的AI优势。

8 个工具
xix.ai
数据分析 用于收入看板、转化漏斗分析及产品指标分析的 AI SQL 助手
用于收入看板、转化漏斗分析及产品指标分析的 AI SQL 助手

2026年最新最优秀的AI SQL辅助工具排名揭晓!XIX.AI精心挑选了一系列功能强大的工具,这些工具会定期更新,并通过真实的场景测试来验证其性能。使用这些值得尝试的工具,您可以快速生成精准的收入分析报表、分析销售流程,并追踪产品各项指标,从而大幅提升工作效率。立即探索,找到最适合您的数据驱动决策工具!238个字符

9 个工具
xix.ai
音乐创作 最佳用于歌曲草稿的 AI 旋律创作工具
最佳用于歌曲草稿的 AI 旋律创作工具

2026 年最新最佳顶级评分 AI 旋律创作工具,助力歌曲草稿创作!XIX.AI 精心策划了一套极具影响力且经过严格真实世界测试的变革性合集,旨在提供最佳的创作体验。您可以找到详细的免费与付费版对比、精准的排名以及必试选项,这些工具旨在帮助您轻松创作出令人惊艳的歌曲草稿,并显著提升您的创意生产力。立即探索,发现您的完美工具!

8 个工具
xix.ai
聊天机器人 最佳AI对话训练工具,助你备战面试
最佳AI对话训练工具,助你备战面试

2026年最新、最受好评的AI面试模拟训练工具现已登陆XIX.AI!这份精心精选的合集收录了功能强大、具有革命性意义的工具,它们均经过严格的实际测试,能够提供精准的反馈。 您将看到免费版与付费版的对比分析以及详细排名,助您挑选出必试之选,从而提升自信并精进技能。立即探索,发现助您面试成功的完美工具!

12 个工具
xix.ai
评论 (3)
0/500
JeffreyThomas
JeffreyThomas 2026-03-14 04:01:22

Como usuario que solo tiene conocimientos básicos, elegir el modelo adecuado es un dolor de cabeza. Este artículo menciona problemas prácticos que son ciertos; a veces, el modelo parece brillar en la prueba, pero en la práctica simplemente falla. Me pregunto si el RewardBench actualizado ayuda a predecir cuándo un modelo se 'descompone' de manera realista. Si las empresas confían demasiado en las métricas, podrían terminar con un fiasco en producción 😅. ¿Habrá herramientas más accesibles para los equipos pequeños?

DonaldGonzález
DonaldGonzález 2025-12-07 06:30:36

この記事、実運用でのAIモデルの難しさをしっかり分析してますね。特にリアルワールドでの性能評価の課題は興味深い。AI導入が進む中で、本当に役立つモデル選びができる企業が勝ち残るのかも。ユーザー体験を考えると、ベンチマークだけで選ぶのは危険かもしれない... 😅

CarlMartin
CarlMartin 2025-09-17 14:30:37

C'est intéressant, mais j'aimerais voir plus d'exemples concrets sur comment évaluer la performance des modèles en situation réelle. Parfois les benchmarks ne reflètent pas la complexité du terrain 😅

OR