选项
首页
新闻
随着Sol和Luna的加入,OpenAI GPT-6在各项基准测试中将令牌成本削减了一半

随着Sol和Luna的加入,OpenAI GPT-6在各项基准测试中将令牌成本削减了一半

2026-10-04
15

据Artificial Analysis报道,GPT-6 Sol(最高配置)在智能排名中位居榜首,售价为48美元。图片来源:Getty Images

在OpenAI发布GPT-6 Sol和Luna之后,解决方案工程主管马特·韦弗(Matt Weaver)向《AI Magazine》解释了这些新模型如何为企业提供更强的运营灵活性。

OpenAI 近期推出了 GPT-6 Astra,并将其描述为“全球最智能、最契合需求的模型”。随后,这家人工智能实验室又发布了 GPT-6 Sol 和 GPT-6 Luna,这两款高性价比的变体模型采用与旗舰模型 GPT-6 Astra 类似的训练方法。

随着对代币使用成本不断攀升的担忧日益加剧,人工智能公司之间的价格竞争愈发激烈,尤其是当中国开放式大模型正威胁着抢占企业客户市场之际。

基准测试公司Artificial Analysis指出,GPT-6 Sol和Luna与GPT-5.6 Sol及Luna相比,成本降低了50%,正在“推动成本效率的边界”。

OpenAI 解决方案工程主管马特·韦弗(Matt Weaver)向《AI Magazine》表示:“借助 GPT-6 Sol 和 Luna,我们为企业提供了更大的灵活性,使其能够根据具体工作需求选择合适的模型。”

OpenAI 解决方案工程主管马特·韦弗。图片来源:马特·韦弗/LinkedIn

将模型与工作流程相匹配

OpenAI 声称其 GPT-6 模型在成本-智能曲线上处于领先地位,通过专为高效、大规模部署设计的基础设施,在所有层级上均提供卓越的能力。

该公司指出,缓存和推理技术的进步使得这些模型能够以更低的成本提供服务,与 GPT-5.6 的促销价格相比,Sol 和 Luna 的 API 价格降低了 50%,从而将节省的成本直接惠及用户。

在解释各AI模型的独特作用时,Matt补充道:“GPT-6 Astra专为要求最严苛的项目而设计,在这些项目中,最大性能至关重要。

OpenAI GPT-6 在各项基准测试中将 Sol 和 Luna 的代币成本减半

Matt 解释道:“GPT-6 Sol 专为复杂的专业任务而设计,包括繁复的业务工作流和编码;而 GPT-6 Luna 则为文档摘要或信息提取等高吞吐量、定义明确的任务提供了更高效的解决方案。

“Sol 和 Luna 将 Astra 在专业工作、事实准确性、编码和计算机应用方面的进步,融入到更快、更经济实惠的模型中。随着 AI 从实验阶段过渡到核心业务运营,为每种任务类型选择合适的模型至关重要。

“我们的目标是让先进的人工智能在各组织中得到实际应用——帮助团队加快工作节奏、做出更明智的决策,并将更多时间投入到更高价值的工作中。”

关键事实

  • OpenAI 将 GPT-6 Sol 和 Luna 的 API 价格较 GPT-5.6 下调了 50%
  • GPT-6 Sol 在 AutomationBench 上的表现超越了 Claude Opus 5,而成本仅为其 9%
  • GPT-6 Sol(最高配置)的输出速度达到每秒 131 个令牌
  • Intelligence Index 任务成本降至 Sol 版 1.06 美元、Luna 版 0.07 美元
  • GPT-6 Sol和Luna在AA-Omniscience基准测试中均表现出更低的幻觉率。

模型性能分析

OpenAI强调,在跨应用程序测试业务工作流的AutomationBench平台上,GPT-6 Sol在“xhigh”努力级别下的表现优于Claude Opus 5在“max”努力级别下的表现,而其每项任务的成本仅为Opus 5的9%。

该公司指出,在“高”努力级别下,GPT-6 Luna 的表现较其前代产品提升了 5.4 个百分点,而每任务成本降低了 58%。

OpenAI 指出,在评估代理在复杂专业工作流中表现的“Agents’ Last Exam”测试中,以“最大努力”模式运行的 GPT-6 Sol 得分达到 56.4%,超过了 Claude Opus 5 在该评估中的最高得分,且每任务成本降低了 61%。

该公司指出,在评估编码代理生成的代码变更是否可直接合并到真实代码库的“FrontierCode”测试中,GPT-6 Sol 相较于 GPT-5.6 Sol 表现出了显著提升,且以更低的成本达到了与 Claude Fable 5.1 xhigh 相当的水平。

这两款模型在“AA-Omniscience”(Artificial Analysis 用于评估知识和幻觉的基准测试)中的幻觉率均有所降低。

“借助 GPT-6 Sol 和 Luna,我们为企业提供了更大的灵活性,使其能够根据具体工作需求选择合适的模型。

”——OpenAI 解决方案工程主管

Matt

Weaver

每项智能指数任务的成本。图片来源:Artificial Analysis

这家基准测试公司解释称,GPT-6 Sol 版本包含六个模型,每个模型在智能水平、性能和定价方面均具有鲜明的特点。通过对比这六个模型的关键指标,Artificial Analysis 发现:

  • 在智能方面,GPT-6 Sol系列的顶级模型是GPT-6 Sol (max),其智能指数为48。
  • 在输出速度方面,最快的模型是 GPT-6 Sol (max),达到 131 t/s。
  • 在延迟方面,GPT-6 Sol (Non-reasoning) 以 0.93 秒的首次回答令牌响应时间表现最佳。
  • 在定价方面,GPT-6 Sol (low) 的单任务成本最低,为 0.13 美元。各模型之间的价格差异最高可达 8 倍。

该公司发现,在所有模型中,智能指数和编码代理指数的得分与 GPT-5.6 保持一致,部分评估指标有所进步,而另一些则出现退步。

GPT-6 Sol 专为高难度专业工作而设计——从复杂的业务工作流到编程——而 GPT-6 Luna 则为文档摘要或信息提取等高吞吐量、定义明确的任务提供了更高效的选项

。——OpenAI 解决方案工程主管 Matt Weaver

在 FrontierCode 1.1 Main⁠ 中,AI 代理编写的代码不仅按正确性评分,还会根据“可合并性”进行评分:例如测试质量、范围规范、代码风格以及对代码库标准的遵守情况。图片来源:OpenAI

成本效率的重要性

围绕AI模型定价的竞争日益激烈,这往往是由低成本的中国模型推动的。 正如布鲁金斯学会的凯尔·陈(Kyle Chan)在博客中指出的,中国模型大多是开源的,这使用户能够定制模型,并以更低的价格获得相当于美国模型 90% 性能的模型。因此,这些模型正在以成本为导向的企业中迅速占据一席之地。

OpenAI正积极调整战略以保持竞争力;尽管新模型每项任务的输出令牌量略有增加,但运行“人工智能分析指数”的成本却显著降低:

  • GPT-6 Sol(最高配置):每项任务成本为1.06美元(较GPT-5.6 Sol的1.99美元下降约50%),尽管输出令牌量从GPT-5.6的2.9万增至3.1万。
  • GPT-6 Luna(最高配置):每项任务成本为0.07美元(较GPT-5.6 Luna的0.18美元下降约60%),尽管输出令牌量从GPT-5.6的4.1万增加至5.1万。

Artificial Analysis 指出,这两款产品的发布使 OpenAI 能够占据成本效益帕累托前沿(即在不相应提高价格的情况下无法进一步提升性能的最佳边界)的相当大一部分。

通过在不牺牲性能的前提下降低准入门槛,OpenAI 正致力于解决企业面临的“令牌疲劳”问题,同时抵御低成本市场竞争对手的挑战。

相关文章
Hexagon:超过半数的成年人对机器人充满热情 Hexagon:超过半数的成年人对机器人充满热情 机器人正越来越多地融入企业运营。图片来源:HumanoidHexagon的数据表明,59%的成年人对与机器人共事感到兴奋,但正在崛起的“机器人一代”儿童对人工智能工作场所的期待更为强烈Hexagon的最新数据显示,超过半数的成年人对与机器人共事的前景感到兴奋。该数据将成年人的观点与儿童的观点进行了对比,后者持有不同看法,并将引领下一代。数据显示,五分之四的儿童(80%)表示对机器人充满期待,而成年
AI坟场:一份不断更新的失败项目与初创公司清单 AI坟场:一份不断更新的失败项目与初创公司清单 Relay 是一家定位为 Zapier 替代方案的人工智能驱动工作流自动化平台,已于周一停止运营。该服务曾允许用户通过人工智能代理实现电子邮件和任务工作流的自动化,但随着 OpenAI、谷歌等主要平台将类似的自动化功能直接整合到其生态系统中,这家成立五年的 Relay 难以证明其作为独立产品的存在价值。Relay这家被大型平台超越的初创公司,反映了当前行业格局的一个侧面。然而,许多人工智能项目甚至
OpenAI 押注家庭,ChatGPT 深入千家万户 OpenAI 押注家庭,ChatGPT 深入千家万户 ChatGPT 将生成式 AI 推向聚光灯下已逾三年,OpenAI 正将其业务范围从个人用户扩展至整个家庭。OpenAI 正在旧金山招聘一名产品经理,以开发其平台上的家庭导向体验,目标受众包括父母、照护者和老年人。根据职位列表,该职位要求具备为家庭及其他对信任敏感的消费者应用开发产品的背景。此次招聘与 ChatGPT 不断演变的用户群体相契合,其用户年龄已超出最初的年轻群体。Sensor Tower 独家向 TechCrunch 分享的数据显示,全球范围内,35 岁及以上用户在 Q2 占 Cha
相关专题推荐
图像编辑 适用于时尚电商照片的AI修图工具
适用于时尚电商照片的AI修图工具

2026年最新、最受欢迎、评分最高的时尚电商图片AI修图工具已登陆XIX.AI!这份精心筛选的清单汇集了功能强大、颠覆行业的解决方案,可帮助提升图像质量、加快编辑速度,并呈现专业级效果。 我们通过实际测试提供精准的排名,并详细对比了免费版与付费版的功能。这些必试工具能帮助创作者克服常见难题,并显著提升工作效率。立即探索,找到打造完美线上商品展示的理想工具!

9 个工具
xix.ai
漫画创作 用于控制纵向故事节奏、对话框和场景节奏的AI网络漫画分镜布局工具
用于控制纵向故事节奏、对话框和场景节奏的AI网络漫画分镜布局工具

2026年最新最佳AI网络漫画分镜排版工具——专为竖版故事节奏、对话气泡和场景韵律设计——现已登陆XIX.AI!这份精心精选的合集收录了评分最高的工具,它们提供强大且具有革命性的解决方案,帮助创作者提升写作效率、优化内容创作流程,并充分释放其创造潜力。 每周更新免费与付费版本对比分析、实际测试报告及最新排名。立即探索,找到最适合您进行专业网络漫画创作的理想工具!

10 个工具
xix.ai
设计 AI 样机生成器:更好地展示应用程序、包装和海报
AI 样机生成器:更好地展示应用程序、包装和海报

2026 最新最佳 AI Mockup 生成器 顶级精选列表,展示强大且具颠覆性的工具,帮助创作者以令人惊叹的质量呈现应用程序包装和海报,包含真实世界测试及免费与付费版对比。立即探索,解锁你的 AI 优势

10 个工具
xix.ai
设计与艺术 AI 风格迁移平台:用独特的视觉效果重新想象照片
AI 风格迁移平台:用独特的视觉效果重新想象照片

2026 年最新最佳顶级 AI 风格转换平台,由专家评估排名。此精选合集提供强大的变革性工具,帮助用户以令人惊叹的独特视觉效果重新想象照片,轻松提升创造力和生产力。XIX.AI 作为值得信赖的来源,提供每周更新的免费与付费对比见解以及真实世界测试。立即探索,发现您的完美工具,解锁您的 AI 优势。

10 个工具
xix.ai
商业 用于定价、商品管理和促销的 AI Shopify 竞争对手监控平台
用于定价、商品管理和促销的 AI Shopify 竞争对手监控平台

2026 年最新最佳 AI 平台,用于在 Shopify 上追踪竞争对手,从而在定价、商品陈列和促销活动方面保持领先。XIX.AI 精选顶级评分的强大工具,提供真实世界测试以及每周更新排名中的免费与付费对比。必试解决方案有助于提升生产力并释放您的 AI 优势。立即探索!

10 个工具
xix.ai
健康养生 居家健身的最佳AI健身教练:通过自适应训练计划进行锻炼
居家健身的最佳AI健身教练:通过自适应训练计划进行锻炼

2026年最新、评分最高的居家健身AI教练现已登陆XIX.AI!我们精心筛选的这份清单汇集了功能强大、颠覆传统的工具,它们能根据您的目标制定自适应训练计划,帮助您提升训练效率并突破健身瓶颈。您可查看免费版与付费版的对比分析,以及实际测试结果和每周更新的排行榜。 立即探索,找到最适合您的工具,今天就开始创建计划,释放您的AI优势!

10 个工具
xix.ai
评论 (0)
0/500
OR