新AI模型表现出更高的推理任务幻觉率

OpenAI新发布的o3和o4-mini AI模型在多个领域表现出色,但与早期模型相比,表现出更高的幻觉倾向,生成更多虚构信息。
幻觉一直是AI的持续挑战,即使对顶级系统也是如此。通常,新模型会降低幻觉率,但o3和o4-mini偏离了这一趋势。
OpenAI内部测试显示,设计为推理模型的o3和o4-mini比之前的推理模型(如o1、o1-mini和o3-mini)以及非推理模型(如GPT-4o)更容易产生幻觉。
幻觉增加的原因尚不清楚,OpenAI对此表示担忧。
OpenAI关于o3和o4-mini的技术报告指出,需要进一步研究以确定推理模型规模扩大时幻觉率上升的原因。报告称,尽管这些模型在编码和数学等领域表现优异,但它们倾向于做出更多断言,导致准确和不准确的输出并存。
在OpenAI的PersonQA基准测试中,o3在33%的回答中出现幻觉,是o1(16%)和o3-mini(14.8%)的两倍。o4-mini表现更差,幻觉率高达48%。
非营利AI研究组织Transluce发现,o3虚构了一些行为,例如声称在ChatGPT之外的2021年MacBook Pro上运行代码,尽管它不具备这种能力。
“我们怀疑o系列模型中使用的强化学习可能会加剧通常通过标准后训练方法缓解的问题,”Transluce研究员、前OpenAI员工Neil Chowdhury在给TechCrunch的电子邮件中表示。
Transluce联合创始人Sarah Schwettmann指出,o3的幻觉率可能会降低其实际效用。
斯坦福大学兼职教授、Workera首席执行官Kian Katanforoosh告诉TechCrunch,他的团队发现o3在编码工作流程中表现优异,但容易生成失效的网站链接。
虽然幻觉可以激发创意想法,但对于法律等行业来说,准确性至关重要,文档中的错误是不可接受的,这使得幻觉成为一个挑战。
整合网络搜索功能显示出提高准确性的潜力。OpenAI的GPT-4o结合网络搜索在SimpleQA上达到了90%的准确率,表明当用户允许第三方搜索访问时,推理模型的幻觉可能会减少。
如果推理模型的规模扩大继续增加幻觉,找到解决方案将变得越来越重要。
“提高模型准确性和可靠性是我们持续研究的关键重点,”OpenAI发言人Niko Felix在给TechCrunch的电子邮件中表示。
AI行业最近转向推理模型,这些模型无需大量计算资源即可提升性能。然而,这一转变似乎增加了幻觉风险,带来了重大挑战。
相关文章
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率
正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。
相关专题推荐
评论 (4)
0/500
It's wild how OpenAI's new models are so advanced yet still make stuff up! 😅 I wonder if these hallucinations could lead to some creative breakthroughs or just more AI headaches.
I read about OpenAI's new models and, wow, those hallucination rates are concerning! If AI starts making up stuff more often, how can we trust it for serious tasks? 🤔 Still, their capabilities sound impressive.
These new AI models sound powerful, but more hallucinations? That's like a sci-fi plot gone wrong! 🧠 Hope they fix it soon.

OpenAI新发布的o3和o4-mini AI模型在多个领域表现出色,但与早期模型相比,表现出更高的幻觉倾向,生成更多虚构信息。
幻觉一直是AI的持续挑战,即使对顶级系统也是如此。通常,新模型会降低幻觉率,但o3和o4-mini偏离了这一趋势。
OpenAI内部测试显示,设计为推理模型的o3和o4-mini比之前的推理模型(如o1、o1-mini和o3-mini)以及非推理模型(如GPT-4o)更容易产生幻觉。
幻觉增加的原因尚不清楚,OpenAI对此表示担忧。
OpenAI关于o3和o4-mini的技术报告指出,需要进一步研究以确定推理模型规模扩大时幻觉率上升的原因。报告称,尽管这些模型在编码和数学等领域表现优异,但它们倾向于做出更多断言,导致准确和不准确的输出并存。
在OpenAI的PersonQA基准测试中,o3在33%的回答中出现幻觉,是o1(16%)和o3-mini(14.8%)的两倍。o4-mini表现更差,幻觉率高达48%。
非营利AI研究组织Transluce发现,o3虚构了一些行为,例如声称在ChatGPT之外的2021年MacBook Pro上运行代码,尽管它不具备这种能力。
“我们怀疑o系列模型中使用的强化学习可能会加剧通常通过标准后训练方法缓解的问题,”Transluce研究员、前OpenAI员工Neil Chowdhury在给TechCrunch的电子邮件中表示。
Transluce联合创始人Sarah Schwettmann指出,o3的幻觉率可能会降低其实际效用。
斯坦福大学兼职教授、Workera首席执行官Kian Katanforoosh告诉TechCrunch,他的团队发现o3在编码工作流程中表现优异,但容易生成失效的网站链接。
虽然幻觉可以激发创意想法,但对于法律等行业来说,准确性至关重要,文档中的错误是不可接受的,这使得幻觉成为一个挑战。
整合网络搜索功能显示出提高准确性的潜力。OpenAI的GPT-4o结合网络搜索在SimpleQA上达到了90%的准确率,表明当用户允许第三方搜索访问时,推理模型的幻觉可能会减少。
如果推理模型的规模扩大继续增加幻觉,找到解决方案将变得越来越重要。
“提高模型准确性和可靠性是我们持续研究的关键重点,”OpenAI发言人Niko Felix在给TechCrunch的电子邮件中表示。
AI行业最近转向推理模型,这些模型无需大量计算资源即可提升性能。然而,这一转变似乎增加了幻觉风险,带来了重大挑战。
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率
正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。
It's wild how OpenAI's new models are so advanced yet still make stuff up! 😅 I wonder if these hallucinations could lead to some creative breakthroughs or just more AI headaches.
I read about OpenAI's new models and, wow, those hallucination rates are concerning! If AI starts making up stuff more often, how can we trust it for serious tasks? 🤔 Still, their capabilities sound impressive.
These new AI models sound powerful, but more hallucinations? That's like a sci-fi plot gone wrong! 🧠 Hope they fix it soon.





首页






