美国人工智能模型与深度求索(DeepSeek)相似:性能更差,成本更高,但更符合美国合规要求

前OpenAI首席技术官Mustafa Suleyman的首个项目意外地翻转了中美之间大语言模型开发的剧本。7月15日,他推出了Thinking Machines Lab并发布了其首款模型Inkling。该模型利用受DeepSeek-V3启发的混合专家架构,并利用来自Moonshot的Kimi K2.5等开放模型的合成数据进行后训练初始化,结果喜忧参半。在多个基准测试中,Inkling落后于Kimi和GLM,且定价明显更高。尽管筹集了20亿美元并实现了120亿美元的估值,但首秀未达预期,然而Suleyman从一开始可能就没打算跻身顶级行列。
审视硬件,Inkling匹配了明星实验室的声望。它采用具有9750亿总参数的混合专家架构,每个令牌激活410亿参数。预训练使用了45万亿个令牌,涵盖文本、图像、音频和视频,支持高达100万个令牌的上下文。该模型处理文本、图像和音频,输出文本,同时允许调整推理强度以平衡性能、速度和成本。权重以宽松的Apache 2.0许可证发布,开发者可以通过Thinking Machines的Tinker平台自行部署或微调。策略很明确:Inkling不直接面向消费者,而是作为企业AI应用的基础。
技术报告揭示了其架构中的一个关键细节。Thinking Machines明确表示,Inkling的混合专家设计遵循DeepSeek-V3,具有众多专家模块,其中每个令牌仅激活子集,以及DeepSeek-V3的无助手损失负载均衡。中国的影响延伸至训练:后训练开始于使用来自开放权重模型的合成数据进行监督微调,特别引用了Kimi K2.5。
一条清晰的路线图浮现出来:由OpenAI前CTO创立的美国实验室,其首款模型模仿了DeepSeek的架构,后训练依赖于Kimi的数据。借鉴开放模型本身并非问题,因为DeepSeek和Kimi公开共享权重和使用权限,建立在公共成就之上。更引人注目的是,尽管吸收了中文模型技术,Inkling未能超越其前辈。Thinking Machines坦率承认:Inkling目前不是最强的模型,无论是开源还是闭源。
数字凸显了差距。在最终的人类考试纯文本评估中,Inkling得分29.7%,而Kimi K2.6和GLM 5.2分别达到35.9%和40.1%。启用工具后,Inkling升至46%,仍落后于Kimi K2.6的54%和GLM 5.2的54.7%。在SWE-Bench Pro中,测试真实的软件工程能力,Inkling得分54.3%,而Kimi K2.6为58.6%,GLM 5.2为62.1%。差距在Terminal Bench 2.1中最为明显,Inkling得分63.8%,而Kimi K2.6和GLM 5.2分别达到71.3%和82.7%。
Inkling在网络应用设计、音频理解和安全评估方面表现出色,甚至在某些数学任务中优于Kimi和DeepSeek。然而,它尚未达到综合推理、编程和代理能力的顶级行列。定价未提供任何缓解:在Tinker平台上,64K版本每百万预填充令牌收费1.87美元,每百万采样令牌收费4.68美元,这已经是五天的折扣价。256K版本分别收费3.74美元和9.36美元。与Kimi K2.6的API费率0.95美元输入和4美元输出,以及GLM 5.2的1.4美元和4.4美元相比,Inkling的预填充价格几乎是Kimi K2.6的两倍,生成成本更高且无明显价格优势。局势微妙:架构参考DeepSeek,后训练依赖Kimi,性能落后于中国领先的开放模型,且定价更高。
intrigue在于Thinking Machines独特的背景。该公司类似于OpenAI校友网络——2025年2月推出,约30人的团队中有三分之二来自OpenAI,其他人来自Meta和Mistral。创始成员包括John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,路透社报道Suleyman从其前雇主那里招募了至少20名研究人员。
Suleyman于2018年加入OpenAI,参与DALL-E、Codex、ChatGPT和Sora的开发,于2022年成为CTO,并在Altman于2023年11月被解雇后短暂担任临时CEO。这个熟悉OpenAI发展和产品化的团队离开以构建新的技术系统,导致外界期望一条受OpenAI启发的路线。相反,主要技术来源指向中国模型,标志着重大转变:最了解OpenAI的人最终采用了中国模型的技术蓝图。
这一结论需要仔细分析。OpenAI最近的尖端模型是闭源的,阻止了外部访问权重、架构或训练计划。即使Suleyman了解内部技术,他也不能将OpenAI的商业秘密转移到新公司。相反,DeepSeek和Kimi已公开发布权重和技术报告,允许其架构、训练方法和工具链被合法研究和重用。
Inkling是一个开放权重模型,对于构建开放生态系统的公司而言,采用来自DeepSeek和Kimi等开放模型的成熟解决方案是一个合乎逻辑的工程选择。开发开放模型而忽视公开可用的中国成就将产生更高的试错成本。因此,借鉴中国模型并不证明Suleyman认为DeepSeek超越OpenAI。开放性和参考条件的差异是明显的,但信号很清晰:中国模型已成为美国AI团队在开放权重空间中的关键参考。
真正的问题是,为什么Thinking Machines拥有现有的架构和训练经验,却产生了性能更弱且价格更高的Inkling。Suleyman拥有顶级团队、充足资金和最新的NVIDIA训练系统。没有理由忽视这些差距,表明高成本替代方案可能是经过计算的决定。
考虑到Thinking Machines的待遇,Inkling应该不仅仅是一个不错的模型。2025年7月,该公司在发布任何产品之前完成了20亿美元的种子轮融资,估值120亿美元,投资者包括a16z、NVIDIA、AMD和Sequoia。四个月后,谈判旨在达到高达5000亿美元的估值,将该公司定位为OpenAI和Anthropic的潜在竞争对手。发布一款表现落后于中国模型且成本更高的产品未达预期。然而,从商业角度来看,Suleyman可能从未打算赢得基准测试。
公司强调开放权重、多模态性和可定制性,鼓励企业使用Tinker将Inkling微调为针对客户服务、编码和行业代理的专业模型。Suleyman押注于一个不优先考虑基准排名的市场。企业更关心私有部署、数据控制以及根据业务需求进行持续训练。这些需求中的很大一部分由中国开放模型满足:OpenAI和Anthropic仍然是闭源的,而在Meta的Llama4表现不佳后,它减少了开源工作。与此同时,DeepSeek、Kimi、Qwen和GLM不断发布权重,性能接近美国闭源模型,但价格低得多。
美国企业迅速做出回应——根据CNBC提供的OpenRouter数据,自2026年2月以来,美国企业通过该平台调用的令牌中中国模型的周份额已超过30%,达到46%,而2025年上半年平均为4.5%。Cursor为Composer2测试了多个基础模型,最终选择Kimi K2.5,因为其评估强劲。Bridgewater Fund通过Tinker微调了Alibaba的Qwen,取得了比一些顶级闭源模型更好的结果。中国开放模型已成为美国企业的省钱捷径,但这条路径现在面临压力。
同时,美国对中国AI模型的监管氛围正在收紧。相关部门已发出关于数据安全、模型来源和供应链风险的警告,一些使用中国模型的公司面临调查。即使没有统一限制,政策不确定性也影响企业选择,特别是那些处理政府业务和敏感数据的企业。
这为Inkling创造了市场空间:一家美国公司的开放权重模型,使用Apache 2.0许可证,支持私有部署和定制。美国企业选择它,无需担心使用中国模型带来的政治争议,使其更容易通过政府客户和大型企业的合规审查。Inkling的真正价值在于这种合规确定性——Suleyman将DeepSeek和Kimi的公共成就转化为由美国公司提供的模型。它不需要在基准测试中击败中国模型,只需成为犹豫继续使用中国模型的美国企业的可接受选择。这解释了其较高的定价:政策缩小了竞争范围,使得性能和价格差距变得不那么重要。对于某些美国企业来说,一款稍弱且更昂贵的模型就足够了。
相关文章
Meta 在用户强烈反对后取消了 AI 照片编辑功能
Meta,这家社交媒体巨头,再次卷入关于人工智能与用户隐私之间微妙平衡的公开辩论。据 TechCrunch 报道,Meta 的 Superintelligence Labs 本周早些时候推出了一款新的 AI 图像生成器 Muse Image。然而,一个备受好评的关键功能——允许用户通过“@”符号标记来修改和生成来自公开 Instagram 账户的图像——由于缺乏适当的通知机制,立即引发了用户以及 CAA 等机构的强烈反对。面对强烈的批评,Meta 迅速撤销了该决定,并于周五通过博客文章宣布将
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
相关专题推荐
评论 (0)
0/500

前OpenAI首席技术官Mustafa Suleyman的首个项目意外地翻转了中美之间大语言模型开发的剧本。7月15日,他推出了Thinking Machines Lab并发布了其首款模型Inkling。该模型利用受DeepSeek-V3启发的混合专家架构,并利用来自Moonshot的Kimi K2.5等开放模型的合成数据进行后训练初始化,结果喜忧参半。在多个基准测试中,Inkling落后于Kimi和GLM,且定价明显更高。尽管筹集了20亿美元并实现了120亿美元的估值,但首秀未达预期,然而Suleyman从一开始可能就没打算跻身顶级行列。
审视硬件,Inkling匹配了明星实验室的声望。它采用具有9750亿总参数的混合专家架构,每个令牌激活410亿参数。预训练使用了45万亿个令牌,涵盖文本、图像、音频和视频,支持高达100万个令牌的上下文。该模型处理文本、图像和音频,输出文本,同时允许调整推理强度以平衡性能、速度和成本。权重以宽松的Apache 2.0许可证发布,开发者可以通过Thinking Machines的Tinker平台自行部署或微调。策略很明确:Inkling不直接面向消费者,而是作为企业AI应用的基础。
技术报告揭示了其架构中的一个关键细节。Thinking Machines明确表示,Inkling的混合专家设计遵循DeepSeek-V3,具有众多专家模块,其中每个令牌仅激活子集,以及DeepSeek-V3的无助手损失负载均衡。中国的影响延伸至训练:后训练开始于使用来自开放权重模型的合成数据进行监督微调,特别引用了Kimi K2.5。
一条清晰的路线图浮现出来:由OpenAI前CTO创立的美国实验室,其首款模型模仿了DeepSeek的架构,后训练依赖于Kimi的数据。借鉴开放模型本身并非问题,因为DeepSeek和Kimi公开共享权重和使用权限,建立在公共成就之上。更引人注目的是,尽管吸收了中文模型技术,Inkling未能超越其前辈。Thinking Machines坦率承认:Inkling目前不是最强的模型,无论是开源还是闭源。
数字凸显了差距。在最终的人类考试纯文本评估中,Inkling得分29.7%,而Kimi K2.6和GLM 5.2分别达到35.9%和40.1%。启用工具后,Inkling升至46%,仍落后于Kimi K2.6的54%和GLM 5.2的54.7%。在SWE-Bench Pro中,测试真实的软件工程能力,Inkling得分54.3%,而Kimi K2.6为58.6%,GLM 5.2为62.1%。差距在Terminal Bench 2.1中最为明显,Inkling得分63.8%,而Kimi K2.6和GLM 5.2分别达到71.3%和82.7%。
Inkling在网络应用设计、音频理解和安全评估方面表现出色,甚至在某些数学任务中优于Kimi和DeepSeek。然而,它尚未达到综合推理、编程和代理能力的顶级行列。定价未提供任何缓解:在Tinker平台上,64K版本每百万预填充令牌收费1.87美元,每百万采样令牌收费4.68美元,这已经是五天的折扣价。256K版本分别收费3.74美元和9.36美元。与Kimi K2.6的API费率0.95美元输入和4美元输出,以及GLM 5.2的1.4美元和4.4美元相比,Inkling的预填充价格几乎是Kimi K2.6的两倍,生成成本更高且无明显价格优势。局势微妙:架构参考DeepSeek,后训练依赖Kimi,性能落后于中国领先的开放模型,且定价更高。
intrigue在于Thinking Machines独特的背景。该公司类似于OpenAI校友网络——2025年2月推出,约30人的团队中有三分之二来自OpenAI,其他人来自Meta和Mistral。创始成员包括John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,路透社报道Suleyman从其前雇主那里招募了至少20名研究人员。
Suleyman于2018年加入OpenAI,参与DALL-E、Codex、ChatGPT和Sora的开发,于2022年成为CTO,并在Altman于2023年11月被解雇后短暂担任临时CEO。这个熟悉OpenAI发展和产品化的团队离开以构建新的技术系统,导致外界期望一条受OpenAI启发的路线。相反,主要技术来源指向中国模型,标志着重大转变:最了解OpenAI的人最终采用了中国模型的技术蓝图。
这一结论需要仔细分析。OpenAI最近的尖端模型是闭源的,阻止了外部访问权重、架构或训练计划。即使Suleyman了解内部技术,他也不能将OpenAI的商业秘密转移到新公司。相反,DeepSeek和Kimi已公开发布权重和技术报告,允许其架构、训练方法和工具链被合法研究和重用。
Inkling是一个开放权重模型,对于构建开放生态系统的公司而言,采用来自DeepSeek和Kimi等开放模型的成熟解决方案是一个合乎逻辑的工程选择。开发开放模型而忽视公开可用的中国成就将产生更高的试错成本。因此,借鉴中国模型并不证明Suleyman认为DeepSeek超越OpenAI。开放性和参考条件的差异是明显的,但信号很清晰:中国模型已成为美国AI团队在开放权重空间中的关键参考。
真正的问题是,为什么Thinking Machines拥有现有的架构和训练经验,却产生了性能更弱且价格更高的Inkling。Suleyman拥有顶级团队、充足资金和最新的NVIDIA训练系统。没有理由忽视这些差距,表明高成本替代方案可能是经过计算的决定。
考虑到Thinking Machines的待遇,Inkling应该不仅仅是一个不错的模型。2025年7月,该公司在发布任何产品之前完成了20亿美元的种子轮融资,估值120亿美元,投资者包括a16z、NVIDIA、AMD和Sequoia。四个月后,谈判旨在达到高达5000亿美元的估值,将该公司定位为OpenAI和Anthropic的潜在竞争对手。发布一款表现落后于中国模型且成本更高的产品未达预期。然而,从商业角度来看,Suleyman可能从未打算赢得基准测试。
公司强调开放权重、多模态性和可定制性,鼓励企业使用Tinker将Inkling微调为针对客户服务、编码和行业代理的专业模型。Suleyman押注于一个不优先考虑基准排名的市场。企业更关心私有部署、数据控制以及根据业务需求进行持续训练。这些需求中的很大一部分由中国开放模型满足:OpenAI和Anthropic仍然是闭源的,而在Meta的Llama4表现不佳后,它减少了开源工作。与此同时,DeepSeek、Kimi、Qwen和GLM不断发布权重,性能接近美国闭源模型,但价格低得多。
美国企业迅速做出回应——根据CNBC提供的OpenRouter数据,自2026年2月以来,美国企业通过该平台调用的令牌中中国模型的周份额已超过30%,达到46%,而2025年上半年平均为4.5%。Cursor为Composer2测试了多个基础模型,最终选择Kimi K2.5,因为其评估强劲。Bridgewater Fund通过Tinker微调了Alibaba的Qwen,取得了比一些顶级闭源模型更好的结果。中国开放模型已成为美国企业的省钱捷径,但这条路径现在面临压力。
同时,美国对中国AI模型的监管氛围正在收紧。相关部门已发出关于数据安全、模型来源和供应链风险的警告,一些使用中国模型的公司面临调查。即使没有统一限制,政策不确定性也影响企业选择,特别是那些处理政府业务和敏感数据的企业。
这为Inkling创造了市场空间:一家美国公司的开放权重模型,使用Apache 2.0许可证,支持私有部署和定制。美国企业选择它,无需担心使用中国模型带来的政治争议,使其更容易通过政府客户和大型企业的合规审查。Inkling的真正价值在于这种合规确定性——Suleyman将DeepSeek和Kimi的公共成就转化为由美国公司提供的模型。它不需要在基准测试中击败中国模型,只需成为犹豫继续使用中国模型的美国企业的可接受选择。这解释了其较高的定价:政策缩小了竞争范围,使得性能和价格差距变得不那么重要。对于某些美国企业来说,一款稍弱且更昂贵的模型就足够了。
Meta 在用户强烈反对后取消了 AI 照片编辑功能
Meta,这家社交媒体巨头,再次卷入关于人工智能与用户隐私之间微妙平衡的公开辩论。据 TechCrunch 报道,Meta 的 Superintelligence Labs 本周早些时候推出了一款新的 AI 图像生成器 Muse Image。然而,一个备受好评的关键功能——允许用户通过“@”符号标记来修改和生成来自公开 Instagram 账户的图像——由于缺乏适当的通知机制,立即引发了用户以及 CAA 等机构的强烈反对。面对强烈的批评,Meta 迅速撤销了该决定,并于周五通过博客文章宣布将
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有





首页






