选项
首页
新闻
AI基准:我们现在应该忽略它们吗?

AI基准:我们现在应该忽略它们吗?

2025-04-10
283

欢迎体验TechCrunch的常规AI通讯!我们将稍作休息,但别担心,您仍可在此处TechCrunch获取所有AI相关报道,包括我的专栏、每日分析和突发新闻。想每天直接在收件箱中获取这些报道?请在此处订阅我们的每日通讯。

本周,埃隆·马斯克的AI初创公司xAI发布了其最新旗舰AI模型Grok 3,该模型为公司Grok聊天机器人应用提供支持。他们使用了惊人的20万个GPU进行训练,该模型在数学、编码等基准测试中超越了包括OpenAI在内的一些顶级模型。

但让我们来谈谈这些基准测试的实际意义。

在TC,我们会报道这些基准测试数据,尽管我们并不总是对此感到兴奋,因为这是AI行业试图展示其模型进步的少数方式之一。问题是,这些流行的AI基准测试往往聚焦于晦涩的内容,给出的分数并不能真正反映AI在人们真正关心的事情上的表现。

沃顿商学院的教授Ethan Mollick在X上表示,亟需更好的测试和独立机构来运行这些测试。他指出,AI公司往往自行报告基准测试结果,这使得结果难以完全信任。

“公开基准测试既‘一般’又饱和,导致许多AI测试就像美食评论,基于主观感受,”Mollick写道。“如果AI对工作至关重要,我们需要更多。”

有很多人试图为AI提出新的基准测试,但大家无法就最佳方案达成一致。一些人认为基准测试应聚焦于经济影响才有意义,而其他人则认为现实世界的采用率和实用性才是成功的真正衡量标准。

这场争论可能永远持续下去。或许,如X用户Roon建议,我们应该少关注新模型和基准测试,除非有重大的AI突破。这可能对我们的心理健康更好,即便意味着错过一些AI热潮。

如前所述,本周AI通讯将暂停。感谢读者们一直以来的支持,陪伴我们经历所有起伏。下次再见。

新闻

图片来源:Nathan Laine/Bloomberg / Getty Images
OpenAI正尝试“解除审查”ChatGPT。Max撰文描述了他们如何改变AI开发方式,以拥抱“知识自由”,即使涉及困难或争议性话题。

前OpenAI首席技术官Mira Murati成立了一家新初创公司Thinking Machines Lab。他们致力于开发工具,“使AI满足[人们]的独特需求和目标”。

xAI发布了Grok 3,并为iOS和网页版的Grok应用添加了新功能。

Meta将于今年春天举办首届专注于生成式AI的开发者大会。大会名为LlamaCon,以他们的Llama模型命名,将于4月29日举行。

Paul撰文介绍了OpenEuroLLM,一个由约20个组织合作的项目,旨在构建“透明的欧洲AI”基础模型,尊重欧盟所有语言的“语言和文化多样性”。

本周研究论文

OpenAI ChatGPT网站显示在笔记本屏幕上的插图照片。

图片来源:Jakub Porzycki/NurPhoto / Getty Images
OpenAI研究人员提出了一个新的AI基准测试SWE-Lancer,用于测试AI的编码能力。该测试包含超过1400个自由软件工程任务,涵盖修复错误、添加功能以及提出技术实现方案。

OpenAI表示,表现最好的模型Anthropic的Claude 3.5 Sonnet在完整的SWE-Lancer基准测试中仅得分40.3%,表明AI仍有很长的路要走。他们未测试较新的模型,如OpenAI的o3-mini或中国的DeepSeek的R1。

本周模型

一家名为Stepfun的中国AI公司发布了一个“开放”AI模型Step-Audio,可理解和生成中文、英文和日文的语音。用户甚至可以调整合成音频的情感和方言,包括唱歌。

Stepfun是多家资金雄厚的中国AI初创公司之一,发布了具有宽松许可的模型。该公司成立于2023年,最近完成了一轮由包括中国国有私募股权公司在内的投资者提供的数亿美元融资。

杂锦

Nous Research DeepHermes

图片来源:Nous Research
AI研究组织Nous Research声称发布了首个结合推理与“直观语言模型能力”的AI模型。

他们的模型DeepHermes-3 Preview可在短链和长链“思维链”之间切换,以平衡准确性和计算能力。在“推理”模式下,它会花更多时间解决较难的问题,并展示其思考过程。

据报道,Anthropic计划很快发布类似模型,OpenAI也表示这是其近期路线图的一部分。

相关文章
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本 在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本 在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略 Frontier AI Labs 拒绝透露针对失控模型的遏制策略 最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率 NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率 正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。
相关专题推荐
写作 适用于长篇写作的AI文章大纲工具
适用于长篇写作的AI文章大纲工具

2026年最新最佳、评分最高的人工智能文章大纲工具,专为长文写作打造!这份精心挑选的合集收录了功能强大、具有革命性意义的工具,它们能生成准确、结构清晰的大纲,并经过实际测试验证,可显著提升写作效率。XIX.AI 便是这份精英精选中的成员之一。 获取免费版与付费版的对比指南,助您选择最适合的工具。立即探索,释放您的AI优势!

9 个工具
xix.ai
聊天机器人 用于语言练习、面试准备和日常流利度的最佳 AI 角色扮演聊天应用
用于语言练习、面试准备和日常流利度的最佳 AI 角色扮演聊天应用

2026 年最新最佳顶级评分 AI 角色扮演聊天应用,用于语言练习、面试准备和日常流利度!XIX.AI 精心策划了一个强大的变革性合集,提供免费与付费对比、真实世界测试以及每周更新的排名。这些必试工具可帮助您提升写作技能,克服流利度挑战,并提高所有日常场景下的沟通效率。立即探索,发现您语言成长的完美工具!

10 个工具
xix.ai
音乐创作 用于混音制作、采样准备及卡拉OK母带处理的 AI 声部分离工具
用于混音制作、采样准备及卡拉OK母带处理的 AI 声部分离工具

2026年最新、最优秀且评分最高的AI音轨分离工具汇总,专为混音制作、采样准备以及卡拉OK音频处理而设计。这些功能强大的创新工具经过实际测试,能够实现精准的音频分离,显著提升工作效率。XIX.AI每周都会更新免费的付费产品对比指南,帮助您找到最适合自身需求的工具。立即探索,发挥您的AI优势。

8 个工具
xix.ai
数据分析 用于收入看板、转化漏斗分析及产品指标分析的 AI SQL 助手
用于收入看板、转化漏斗分析及产品指标分析的 AI SQL 助手

2026年最新最优秀的AI SQL辅助工具排名揭晓!XIX.AI精心挑选了一系列功能强大的工具,这些工具会定期更新,并通过真实的场景测试来验证其性能。使用这些值得尝试的工具,您可以快速生成精准的收入分析报表、分析销售流程,并追踪产品各项指标,从而大幅提升工作效率。立即探索,找到最适合您的数据驱动决策工具!238个字符

9 个工具
xix.ai
音乐创作 最佳用于歌曲草稿的 AI 旋律创作工具
最佳用于歌曲草稿的 AI 旋律创作工具

2026 年最新最佳顶级评分 AI 旋律创作工具,助力歌曲草稿创作!XIX.AI 精心策划了一套极具影响力且经过严格真实世界测试的变革性合集,旨在提供最佳的创作体验。您可以找到详细的免费与付费版对比、精准的排名以及必试选项,这些工具旨在帮助您轻松创作出令人惊艳的歌曲草稿,并显著提升您的创意生产力。立即探索,发现您的完美工具!

8 个工具
xix.ai
聊天机器人 最佳AI对话训练工具,助你备战面试
最佳AI对话训练工具,助你备战面试

2026年最新、最受好评的AI面试模拟训练工具现已登陆XIX.AI!这份精心精选的合集收录了功能强大、具有革命性意义的工具,它们均经过严格的实际测试,能够提供精准的反馈。 您将看到免费版与付费版的对比分析以及详细排名,助您挑选出必试之选,从而提升自信并精进技能。立即探索,发现助您面试成功的完美工具!

12 个工具
xix.ai
评论 (62)
0/500
DavidGreen
DavidGreen 2026-06-17 16:00:23

I mean, benchmarks are just a snapshot—does anyone really trust them when companies train models specifically to ace them? 🤔 Might be better to focus on real-world performance rather than chasing numbers on a leaderboard.

JonathanDavis
JonathanDavis 2025-08-19 14:26:53

AI benchmarks are getting so hyped, but are they even reliable yet? 🤔 Feels like companies just cherry-pick numbers to flex. I’d rather see real-world use cases than some random leaderboard scores.

EdwardWalker
EdwardWalker 2025-08-19 13:00:59

AI benchmarks are getting so hyped, but are they even reliable yet? Feels like we're chasing numbers instead of real progress. 🤔 What do you all think—should we just ignore them for now?

HarrySmith
HarrySmith 2025-08-12 03:00:59

AI benchmarks are cool, but are they just tech flexing? I’d rather see real-world uses than numbers on a chart. 🤔

BillyLewis
BillyLewis 2025-08-04 14:01:00

AI benchmarks sound cool, but are they just overhyped numbers? I’m curious if they really tell us anything useful about real-world performance. 🧐

JimmyWilson
JimmyWilson 2025-08-01 10:48:18

AI benchmarks sound fancy, but are they just tech flexing? I mean, cool numbers, but do they really tell us how AI vibes in the real world? 🤔

OR