随着Sol和Luna的加入,OpenAI GPT-6在各项基准测试中将令牌成本削减了一半
![]()
据Artificial Analysis报道,GPT-6 Sol(最高配置)在智能排名中位居榜首,售价为48美元。图片来源:Getty Images
在OpenAI发布GPT-6 Sol和Luna之后,解决方案工程主管马特·韦弗(Matt Weaver)向《AI Magazine》解释了这些新模型如何为企业提供更强的运营灵活性。
OpenAI 近期推出了 GPT-6 Astra,并将其描述为“全球最智能、最契合需求的模型”。随后,这家人工智能实验室又发布了 GPT-6 Sol 和 GPT-6 Luna,这两款高性价比的变体模型采用与旗舰模型 GPT-6 Astra 类似的训练方法。
随着对代币使用成本不断攀升的担忧日益加剧,人工智能公司之间的价格竞争愈发激烈,尤其是当中国开放式大模型正威胁着抢占企业客户市场之际。
基准测试公司Artificial Analysis指出,GPT-6 Sol和Luna与GPT-5.6 Sol及Luna相比,成本降低了50%,正在“推动成本效率的边界”。
OpenAI 解决方案工程主管马特·韦弗(Matt Weaver)向《AI Magazine》表示:“借助 GPT-6 Sol 和 Luna,我们为企业提供了更大的灵活性,使其能够根据具体工作需求选择合适的模型。”
OpenAI 解决方案工程主管马特·韦弗。图片来源:马特·韦弗/LinkedIn
将模型与工作流程相匹配
OpenAI 声称其 GPT-6 模型在成本-智能曲线上处于领先地位,通过专为高效、大规模部署设计的基础设施,在所有层级上均提供卓越的能力。
该公司指出,缓存和推理技术的进步使得这些模型能够以更低的成本提供服务,与 GPT-5.6 的促销价格相比,Sol 和 Luna 的 API 价格降低了 50%,从而将节省的成本直接惠及用户。
在解释各AI模型的独特作用时,Matt补充道:“GPT-6 Astra专为要求最严苛的项目而设计,在这些项目中,最大性能至关重要。

Matt 解释道:“GPT-6 Sol 专为复杂的专业任务而设计,包括繁复的业务工作流和编码;而 GPT-6 Luna 则为文档摘要或信息提取等高吞吐量、定义明确的任务提供了更高效的解决方案。
“Sol 和 Luna 将 Astra 在专业工作、事实准确性、编码和计算机应用方面的进步,融入到更快、更经济实惠的模型中。随着 AI 从实验阶段过渡到核心业务运营,为每种任务类型选择合适的模型至关重要。
“我们的目标是让先进的人工智能在各组织中得到实际应用——帮助团队加快工作节奏、做出更明智的决策,并将更多时间投入到更高价值的工作中。”
关键事实
- OpenAI 将 GPT-6 Sol 和 Luna 的 API 价格较 GPT-5.6 下调了 50%
- GPT-6 Sol 在 AutomationBench 上的表现超越了 Claude Opus 5,而成本仅为其 9%
- GPT-6 Sol(最高配置)的输出速度达到每秒 131 个令牌
- Intelligence Index 任务成本降至 Sol 版 1.06 美元、Luna 版 0.07 美元
- GPT-6 Sol和Luna在AA-Omniscience基准测试中均表现出更低的幻觉率。
模型性能分析
OpenAI强调,在跨应用程序测试业务工作流的AutomationBench平台上,GPT-6 Sol在“xhigh”努力级别下的表现优于Claude Opus 5在“max”努力级别下的表现,而其每项任务的成本仅为Opus 5的9%。
该公司指出,在“高”努力级别下,GPT-6 Luna 的表现较其前代产品提升了 5.4 个百分点,而每任务成本降低了 58%。
OpenAI 指出,在评估代理在复杂专业工作流中表现的“Agents’ Last Exam”测试中,以“最大努力”模式运行的 GPT-6 Sol 得分达到 56.4%,超过了 Claude Opus 5 在该评估中的最高得分,且每任务成本降低了 61%。
该公司指出,在评估编码代理生成的代码变更是否可直接合并到真实代码库的“FrontierCode”测试中,GPT-6 Sol 相较于 GPT-5.6 Sol 表现出了显著提升,且以更低的成本达到了与 Claude Fable 5.1 xhigh 相当的水平。
这两款模型在“AA-Omniscience”(Artificial Analysis 用于评估知识和幻觉的基准测试)中的幻觉率均有所降低。
“借助 GPT-6 Sol 和 Luna,我们为企业提供了更大的灵活性,使其能够根据具体工作需求选择合适的模型。
”——OpenAI 解决方案工程主管Matt
Weaver
每项智能指数任务的成本。图片来源:Artificial Analysis
这家基准测试公司解释称,GPT-6 Sol 版本包含六个模型,每个模型在智能水平、性能和定价方面均具有鲜明的特点。通过对比这六个模型的关键指标,Artificial Analysis 发现:
- 在智能方面,GPT-6 Sol系列的顶级模型是GPT-6 Sol (max),其智能指数为48。
- 在输出速度方面,最快的模型是 GPT-6 Sol (max),达到 131 t/s。
- 在延迟方面,GPT-6 Sol (Non-reasoning) 以 0.93 秒的首次回答令牌响应时间表现最佳。
- 在定价方面,GPT-6 Sol (low) 的单任务成本最低,为 0.13 美元。各模型之间的价格差异最高可达 8 倍。
该公司发现,在所有模型中,智能指数和编码代理指数的得分与 GPT-5.6 保持一致,部分评估指标有所进步,而另一些则出现退步。
GPT-6 Sol 专为高难度专业工作而设计——从复杂的业务工作流到编程——而 GPT-6 Luna 则为文档摘要或信息提取等高吞吐量、定义明确的任务提供了更高效的选项
。——OpenAI 解决方案工程主管 Matt Weaver
在 FrontierCode 1.1 Main 中,AI 代理编写的代码不仅按正确性评分,还会根据“可合并性”进行评分:例如测试质量、范围规范、代码风格以及对代码库标准的遵守情况。图片来源:OpenAI
成本效率的重要性
围绕AI模型定价的竞争日益激烈,这往往是由低成本的中国模型推动的。 正如布鲁金斯学会的凯尔·陈(Kyle Chan)在博客中指出的,中国模型大多是开源的,这使用户能够定制模型,并以更低的价格获得相当于美国模型 90% 性能的模型。因此,这些模型正在以成本为导向的企业中迅速占据一席之地。
OpenAI正积极调整战略以保持竞争力;尽管新模型每项任务的输出令牌量略有增加,但运行“人工智能分析指数”的成本却显著降低:
- GPT-6 Sol(最高配置):每项任务成本为1.06美元(较GPT-5.6 Sol的1.99美元下降约50%),尽管输出令牌量从GPT-5.6的2.9万增至3.1万。
- GPT-6 Luna(最高配置):每项任务成本为0.07美元(较GPT-5.6 Luna的0.18美元下降约60%),尽管输出令牌量从GPT-5.6的4.1万增加至5.1万。
Artificial Analysis 指出,这两款产品的发布使 OpenAI 能够占据成本效益帕累托前沿(即在不相应提高价格的情况下无法进一步提升性能的最佳边界)的相当大一部分。
通过在不牺牲性能的前提下降低准入门槛,OpenAI 正致力于解决企业面临的“令牌疲劳”问题,同时抵御低成本市场竞争对手的挑战。
相关文章
Hexagon:超过半数的成年人对机器人充满热情
机器人正越来越多地融入企业运营。图片来源:HumanoidHexagon的数据表明,59%的成年人对与机器人共事感到兴奋,但正在崛起的“机器人一代”儿童对人工智能工作场所的期待更为强烈Hexagon的最新数据显示,超过半数的成年人对与机器人共事的前景感到兴奋。该数据将成年人的观点与儿童的观点进行了对比,后者持有不同看法,并将引领下一代。数据显示,五分之四的儿童(80%)表示对机器人充满期待,而成年
AI坟场:一份不断更新的失败项目与初创公司清单
Relay 是一家定位为 Zapier 替代方案的人工智能驱动工作流自动化平台,已于周一停止运营。该服务曾允许用户通过人工智能代理实现电子邮件和任务工作流的自动化,但随着 OpenAI、谷歌等主要平台将类似的自动化功能直接整合到其生态系统中,这家成立五年的 Relay 难以证明其作为独立产品的存在价值。Relay这家被大型平台超越的初创公司,反映了当前行业格局的一个侧面。然而,许多人工智能项目甚至
OpenAI 押注家庭,ChatGPT 深入千家万户
ChatGPT 将生成式 AI 推向聚光灯下已逾三年,OpenAI 正将其业务范围从个人用户扩展至整个家庭。OpenAI 正在旧金山招聘一名产品经理,以开发其平台上的家庭导向体验,目标受众包括父母、照护者和老年人。根据职位列表,该职位要求具备为家庭及其他对信任敏感的消费者应用开发产品的背景。此次招聘与 ChatGPT 不断演变的用户群体相契合,其用户年龄已超出最初的年轻群体。Sensor Tower 独家向 TechCrunch 分享的数据显示,全球范围内,35 岁及以上用户在 Q2 占 Cha
相关专题推荐
评论 (0)
0/500
据Artificial Analysis报道,GPT-6 Sol(最高配置)在智能排名中位居榜首,售价为48美元。图片来源:Getty Images
在OpenAI发布GPT-6 Sol和Luna之后,解决方案工程主管马特·韦弗(Matt Weaver)向《AI Magazine》解释了这些新模型如何为企业提供更强的运营灵活性。
OpenAI 近期推出了 GPT-6 Astra,并将其描述为“全球最智能、最契合需求的模型”。随后,这家人工智能实验室又发布了 GPT-6 Sol 和 GPT-6 Luna,这两款高性价比的变体模型采用与旗舰模型 GPT-6 Astra 类似的训练方法。
随着对代币使用成本不断攀升的担忧日益加剧,人工智能公司之间的价格竞争愈发激烈,尤其是当中国开放式大模型正威胁着抢占企业客户市场之际。
基准测试公司Artificial Analysis指出,GPT-6 Sol和Luna与GPT-5.6 Sol及Luna相比,成本降低了50%,正在“推动成本效率的边界”。
OpenAI 解决方案工程主管马特·韦弗(Matt Weaver)向《AI Magazine》表示:“借助 GPT-6 Sol 和 Luna,我们为企业提供了更大的灵活性,使其能够根据具体工作需求选择合适的模型。”
OpenAI 解决方案工程主管马特·韦弗。图片来源:马特·韦弗/LinkedIn
将模型与工作流程相匹配
OpenAI 声称其 GPT-6 模型在成本-智能曲线上处于领先地位,通过专为高效、大规模部署设计的基础设施,在所有层级上均提供卓越的能力。
该公司指出,缓存和推理技术的进步使得这些模型能够以更低的成本提供服务,与 GPT-5.6 的促销价格相比,Sol 和 Luna 的 API 价格降低了 50%,从而将节省的成本直接惠及用户。
在解释各AI模型的独特作用时,Matt补充道:“GPT-6 Astra专为要求最严苛的项目而设计,在这些项目中,最大性能至关重要。

Matt 解释道:“GPT-6 Sol 专为复杂的专业任务而设计,包括繁复的业务工作流和编码;而 GPT-6 Luna 则为文档摘要或信息提取等高吞吐量、定义明确的任务提供了更高效的解决方案。
“Sol 和 Luna 将 Astra 在专业工作、事实准确性、编码和计算机应用方面的进步,融入到更快、更经济实惠的模型中。随着 AI 从实验阶段过渡到核心业务运营,为每种任务类型选择合适的模型至关重要。
“我们的目标是让先进的人工智能在各组织中得到实际应用——帮助团队加快工作节奏、做出更明智的决策,并将更多时间投入到更高价值的工作中。”
关键事实
- OpenAI 将 GPT-6 Sol 和 Luna 的 API 价格较 GPT-5.6 下调了 50%
- GPT-6 Sol 在 AutomationBench 上的表现超越了 Claude Opus 5,而成本仅为其 9%
- GPT-6 Sol(最高配置)的输出速度达到每秒 131 个令牌
- Intelligence Index 任务成本降至 Sol 版 1.06 美元、Luna 版 0.07 美元
- GPT-6 Sol和Luna在AA-Omniscience基准测试中均表现出更低的幻觉率。
模型性能分析
OpenAI强调,在跨应用程序测试业务工作流的AutomationBench平台上,GPT-6 Sol在“xhigh”努力级别下的表现优于Claude Opus 5在“max”努力级别下的表现,而其每项任务的成本仅为Opus 5的9%。
该公司指出,在“高”努力级别下,GPT-6 Luna 的表现较其前代产品提升了 5.4 个百分点,而每任务成本降低了 58%。
OpenAI 指出,在评估代理在复杂专业工作流中表现的“Agents’ Last Exam”测试中,以“最大努力”模式运行的 GPT-6 Sol 得分达到 56.4%,超过了 Claude Opus 5 在该评估中的最高得分,且每任务成本降低了 61%。
该公司指出,在评估编码代理生成的代码变更是否可直接合并到真实代码库的“FrontierCode”测试中,GPT-6 Sol 相较于 GPT-5.6 Sol 表现出了显著提升,且以更低的成本达到了与 Claude Fable 5.1 xhigh 相当的水平。
这两款模型在“AA-Omniscience”(Artificial Analysis 用于评估知识和幻觉的基准测试)中的幻觉率均有所降低。
“借助 GPT-6 Sol 和 Luna,我们为企业提供了更大的灵活性,使其能够根据具体工作需求选择合适的模型。
”——OpenAI 解决方案工程主管Matt
Weaver
每项智能指数任务的成本。图片来源:Artificial Analysis
这家基准测试公司解释称,GPT-6 Sol 版本包含六个模型,每个模型在智能水平、性能和定价方面均具有鲜明的特点。通过对比这六个模型的关键指标,Artificial Analysis 发现:
- 在智能方面,GPT-6 Sol系列的顶级模型是GPT-6 Sol (max),其智能指数为48。
- 在输出速度方面,最快的模型是 GPT-6 Sol (max),达到 131 t/s。
- 在延迟方面,GPT-6 Sol (Non-reasoning) 以 0.93 秒的首次回答令牌响应时间表现最佳。
- 在定价方面,GPT-6 Sol (low) 的单任务成本最低,为 0.13 美元。各模型之间的价格差异最高可达 8 倍。
该公司发现,在所有模型中,智能指数和编码代理指数的得分与 GPT-5.6 保持一致,部分评估指标有所进步,而另一些则出现退步。
GPT-6 Sol 专为高难度专业工作而设计——从复杂的业务工作流到编程——而 GPT-6 Luna 则为文档摘要或信息提取等高吞吐量、定义明确的任务提供了更高效的选项
。——OpenAI 解决方案工程主管 Matt Weaver
在 FrontierCode 1.1 Main 中,AI 代理编写的代码不仅按正确性评分,还会根据“可合并性”进行评分:例如测试质量、范围规范、代码风格以及对代码库标准的遵守情况。图片来源:OpenAI
成本效率的重要性
围绕AI模型定价的竞争日益激烈,这往往是由低成本的中国模型推动的。 正如布鲁金斯学会的凯尔·陈(Kyle Chan)在博客中指出的,中国模型大多是开源的,这使用户能够定制模型,并以更低的价格获得相当于美国模型 90% 性能的模型。因此,这些模型正在以成本为导向的企业中迅速占据一席之地。
OpenAI正积极调整战略以保持竞争力;尽管新模型每项任务的输出令牌量略有增加,但运行“人工智能分析指数”的成本却显著降低:
- GPT-6 Sol(最高配置):每项任务成本为1.06美元(较GPT-5.6 Sol的1.99美元下降约50%),尽管输出令牌量从GPT-5.6的2.9万增至3.1万。
- GPT-6 Luna(最高配置):每项任务成本为0.07美元(较GPT-5.6 Luna的0.18美元下降约60%),尽管输出令牌量从GPT-5.6的4.1万增加至5.1万。
Artificial Analysis 指出,这两款产品的发布使 OpenAI 能够占据成本效益帕累托前沿(即在不相应提高价格的情况下无法进一步提升性能的最佳边界)的相当大一部分。
通过在不牺牲性能的前提下降低准入门槛,OpenAI 正致力于解决企业面临的“令牌疲劳”问题,同时抵御低成本市场竞争对手的挑战。
Hexagon:超过半数的成年人对机器人充满热情
机器人正越来越多地融入企业运营。图片来源:HumanoidHexagon的数据表明,59%的成年人对与机器人共事感到兴奋,但正在崛起的“机器人一代”儿童对人工智能工作场所的期待更为强烈Hexagon的最新数据显示,超过半数的成年人对与机器人共事的前景感到兴奋。该数据将成年人的观点与儿童的观点进行了对比,后者持有不同看法,并将引领下一代。数据显示,五分之四的儿童(80%)表示对机器人充满期待,而成年
AI坟场:一份不断更新的失败项目与初创公司清单
Relay 是一家定位为 Zapier 替代方案的人工智能驱动工作流自动化平台,已于周一停止运营。该服务曾允许用户通过人工智能代理实现电子邮件和任务工作流的自动化,但随着 OpenAI、谷歌等主要平台将类似的自动化功能直接整合到其生态系统中,这家成立五年的 Relay 难以证明其作为独立产品的存在价值。Relay这家被大型平台超越的初创公司,反映了当前行业格局的一个侧面。然而,许多人工智能项目甚至
OpenAI 押注家庭,ChatGPT 深入千家万户
ChatGPT 将生成式 AI 推向聚光灯下已逾三年,OpenAI 正将其业务范围从个人用户扩展至整个家庭。OpenAI 正在旧金山招聘一名产品经理,以开发其平台上的家庭导向体验,目标受众包括父母、照护者和老年人。根据职位列表,该职位要求具备为家庭及其他对信任敏感的消费者应用开发产品的背景。此次招聘与 ChatGPT 不断演变的用户群体相契合,其用户年龄已超出最初的年轻群体。Sensor Tower 独家向 TechCrunch 分享的数据显示,全球范围内,35 岁及以上用户在 Q2 占 Cha





首页






