选项
首页
新闻
美国人工智能模型与深度求索(DeepSeek)相似:性能更差,成本更高,但更符合美国合规要求

美国人工智能模型与深度求索(DeepSeek)相似:性能更差,成本更高,但更符合美国合规要求

2026-09-03
42

美国人工智能模型与深度求索(DeepSeek)相似:性能更差,成本更高,但更符合美国合规要求

前OpenAI首席技术官Mustafa Suleyman的首个项目意外地翻转了中美之间大语言模型开发的剧本。7月15日,他推出了Thinking Machines Lab并发布了其首款模型Inkling。该模型利用受DeepSeek-V3启发的混合专家架构,并利用来自Moonshot的Kimi K2.5等开放模型的合成数据进行后训练初始化,结果喜忧参半。在多个基准测试中,Inkling落后于Kimi和GLM,且定价明显更高。尽管筹集了20亿美元并实现了120亿美元的估值,但首秀未达预期,然而Suleyman从一开始可能就没打算跻身顶级行列。

审视硬件,Inkling匹配了明星实验室的声望。它采用具有9750亿总参数的混合专家架构,每个令牌激活410亿参数。预训练使用了45万亿个令牌,涵盖文本、图像、音频和视频,支持高达100万个令牌的上下文。该模型处理文本、图像和音频,输出文本,同时允许调整推理强度以平衡性能、速度和成本。权重以宽松的Apache 2.0许可证发布,开发者可以通过Thinking Machines的Tinker平台自行部署或微调。策略很明确:Inkling不直接面向消费者,而是作为企业AI应用的基础。

技术报告揭示了其架构中的一个关键细节。Thinking Machines明确表示,Inkling的混合专家设计遵循DeepSeek-V3,具有众多专家模块,其中每个令牌仅激活子集,以及DeepSeek-V3的无助手损失负载均衡。中国的影响延伸至训练:后训练开始于使用来自开放权重模型的合成数据进行监督微调,特别引用了Kimi K2.5。

一条清晰的路线图浮现出来:由OpenAI前CTO创立的美国实验室,其首款模型模仿了DeepSeek的架构,后训练依赖于Kimi的数据。借鉴开放模型本身并非问题,因为DeepSeek和Kimi公开共享权重和使用权限,建立在公共成就之上。更引人注目的是,尽管吸收了中文模型技术,Inkling未能超越其前辈。Thinking Machines坦率承认:Inkling目前不是最强的模型,无论是开源还是闭源。

数字凸显了差距。在最终的人类考试纯文本评估中,Inkling得分29.7%,而Kimi K2.6和GLM 5.2分别达到35.9%和40.1%。启用工具后,Inkling升至46%,仍落后于Kimi K2.6的54%和GLM 5.2的54.7%。在SWE-Bench Pro中,测试真实的软件工程能力,Inkling得分54.3%,而Kimi K2.6为58.6%,GLM 5.2为62.1%。差距在Terminal Bench 2.1中最为明显,Inkling得分63.8%,而Kimi K2.6和GLM 5.2分别达到71.3%和82.7%。

Inkling在网络应用设计、音频理解和安全评估方面表现出色,甚至在某些数学任务中优于Kimi和DeepSeek。然而,它尚未达到综合推理、编程和代理能力的顶级行列。定价未提供任何缓解:在Tinker平台上,64K版本每百万预填充令牌收费1.87美元,每百万采样令牌收费4.68美元,这已经是五天的折扣价。256K版本分别收费3.74美元和9.36美元。与Kimi K2.6的API费率0.95美元输入和4美元输出,以及GLM 5.2的1.4美元和4.4美元相比,Inkling的预填充价格几乎是Kimi K2.6的两倍,生成成本更高且无明显价格优势。局势微妙:架构参考DeepSeek,后训练依赖Kimi,性能落后于中国领先的开放模型,且定价更高。

intrigue在于Thinking Machines独特的背景。该公司类似于OpenAI校友网络——2025年2月推出,约30人的团队中有三分之二来自OpenAI,其他人来自Meta和Mistral。创始成员包括John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,路透社报道Suleyman从其前雇主那里招募了至少20名研究人员。

Suleyman于2018年加入OpenAI,参与DALL-E、Codex、ChatGPT和Sora的开发,于2022年成为CTO,并在Altman于2023年11月被解雇后短暂担任临时CEO。这个熟悉OpenAI发展和产品化的团队离开以构建新的技术系统,导致外界期望一条受OpenAI启发的路线。相反,主要技术来源指向中国模型,标志着重大转变:最了解OpenAI的人最终采用了中国模型的技术蓝图。

这一结论需要仔细分析。OpenAI最近的尖端模型是闭源的,阻止了外部访问权重、架构或训练计划。即使Suleyman了解内部技术,他也不能将OpenAI的商业秘密转移到新公司。相反,DeepSeek和Kimi已公开发布权重和技术报告,允许其架构、训练方法和工具链被合法研究和重用。

Inkling是一个开放权重模型,对于构建开放生态系统的公司而言,采用来自DeepSeek和Kimi等开放模型的成熟解决方案是一个合乎逻辑的工程选择。开发开放模型而忽视公开可用的中国成就将产生更高的试错成本。因此,借鉴中国模型并不证明Suleyman认为DeepSeek超越OpenAI。开放性和参考条件的差异是明显的,但信号很清晰:中国模型已成为美国AI团队在开放权重空间中的关键参考。

真正的问题是,为什么Thinking Machines拥有现有的架构和训练经验,却产生了性能更弱且价格更高的Inkling。Suleyman拥有顶级团队、充足资金和最新的NVIDIA训练系统。没有理由忽视这些差距,表明高成本替代方案可能是经过计算的决定。

考虑到Thinking Machines的待遇,Inkling应该不仅仅是一个不错的模型。2025年7月,该公司在发布任何产品之前完成了20亿美元的种子轮融资,估值120亿美元,投资者包括a16z、NVIDIA、AMD和Sequoia。四个月后,谈判旨在达到高达5000亿美元的估值,将该公司定位为OpenAI和Anthropic的潜在竞争对手。发布一款表现落后于中国模型且成本更高的产品未达预期。然而,从商业角度来看,Suleyman可能从未打算赢得基准测试。

公司强调开放权重、多模态性和可定制性,鼓励企业使用Tinker将Inkling微调为针对客户服务、编码和行业代理的专业模型。Suleyman押注于一个不优先考虑基准排名的市场。企业更关心私有部署、数据控制以及根据业务需求进行持续训练。这些需求中的很大一部分由中国开放模型满足:OpenAI和Anthropic仍然是闭源的,而在Meta的Llama4表现不佳后,它减少了开源工作。与此同时,DeepSeek、Kimi、Qwen和GLM不断发布权重,性能接近美国闭源模型,但价格低得多。

美国企业迅速做出回应——根据CNBC提供的OpenRouter数据,自2026年2月以来,美国企业通过该平台调用的令牌中中国模型的周份额已超过30%,达到46%,而2025年上半年平均为4.5%。Cursor为Composer2测试了多个基础模型,最终选择Kimi K2.5,因为其评估强劲。Bridgewater Fund通过Tinker微调了Alibaba的Qwen,取得了比一些顶级闭源模型更好的结果。中国开放模型已成为美国企业的省钱捷径,但这条路径现在面临压力。

同时,美国对中国AI模型的监管氛围正在收紧。相关部门已发出关于数据安全、模型来源和供应链风险的警告,一些使用中国模型的公司面临调查。即使没有统一限制,政策不确定性也影响企业选择,特别是那些处理政府业务和敏感数据的企业。

这为Inkling创造了市场空间:一家美国公司的开放权重模型,使用Apache 2.0许可证,支持私有部署和定制。美国企业选择它,无需担心使用中国模型带来的政治争议,使其更容易通过政府客户和大型企业的合规审查。Inkling的真正价值在于这种合规确定性——Suleyman将DeepSeek和Kimi的公共成就转化为由美国公司提供的模型。它不需要在基准测试中击败中国模型,只需成为犹豫继续使用中国模型的美国企业的可接受选择。这解释了其较高的定价:政策缩小了竞争范围,使得性能和价格差距变得不那么重要。对于某些美国企业来说,一款稍弱且更昂贵的模型就足够了。

相关文章
Meta 在用户强烈反对后取消了 AI 照片编辑功能 Meta 在用户强烈反对后取消了 AI 照片编辑功能 Meta,这家社交媒体巨头,再次卷入关于人工智能与用户隐私之间微妙平衡的公开辩论。据 TechCrunch 报道,Meta 的 Superintelligence Labs 本周早些时候推出了一款新的 AI 图像生成器 Muse Image。然而,一个备受好评的关键功能——允许用户通过“@”符号标记来修改和生成来自公开 Instagram 账户的图像——由于缺乏适当的通知机制,立即引发了用户以及 CAA 等机构的强烈反对。面对强烈的批评,Meta 迅速撤销了该决定,并于周五通过博客文章宣布将
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。 DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。 Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额 尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额 尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
相关专题推荐
视频创作 适用于 Reels、Shorts 及产品发布活动的 AI 短视频吸睛点生成器
适用于 Reels、Shorts 及产品发布活动的 AI 短视频吸睛点生成器

2026年最新最全的AI短视频开场白生成器,适用于Reels、Shorts及产品发布活动!XIX.AI精选了经过实际测试、效果惊人且必试的顶级工具,这些工具将彻底改变游戏规则。本页面每周更新,提供免费与付费版本的对比排名,助您找到提升内容创意和生产力的完美解决方案。 立即探索,释放您的AI优势!

11 个工具
xix.ai
写作 适用于长篇写作的AI文章大纲工具
适用于长篇写作的AI文章大纲工具

2026年最新最佳、评分最高的人工智能文章大纲工具,专为长文写作打造!这份精心挑选的合集收录了功能强大、具有革命性意义的工具,它们能生成准确、结构清晰的大纲,并经过实际测试验证,可显著提升写作效率。XIX.AI 便是这份精英精选中的成员之一。 获取免费版与付费版的对比指南,助您选择最适合的工具。立即探索,释放您的AI优势!

9 个工具
xix.ai
聊天机器人 用于语言练习、面试准备和日常流利度的最佳 AI 角色扮演聊天应用
用于语言练习、面试准备和日常流利度的最佳 AI 角色扮演聊天应用

2026 年最新最佳顶级评分 AI 角色扮演聊天应用,用于语言练习、面试准备和日常流利度!XIX.AI 精心策划了一个强大的变革性合集,提供免费与付费对比、真实世界测试以及每周更新的排名。这些必试工具可帮助您提升写作技能,克服流利度挑战,并提高所有日常场景下的沟通效率。立即探索,发现您语言成长的完美工具!

10 个工具
xix.ai
音乐创作 用于混音制作、采样准备及卡拉OK母带处理的 AI 声部分离工具
用于混音制作、采样准备及卡拉OK母带处理的 AI 声部分离工具

2026年最新、最优秀且评分最高的AI音轨分离工具汇总,专为混音制作、采样准备以及卡拉OK音频处理而设计。这些功能强大的创新工具经过实际测试,能够实现精准的音频分离,显著提升工作效率。XIX.AI每周都会更新免费的付费产品对比指南,帮助您找到最适合自身需求的工具。立即探索,发挥您的AI优势。

8 个工具
xix.ai
数据分析 用于收入看板、转化漏斗分析及产品指标分析的 AI SQL 助手
用于收入看板、转化漏斗分析及产品指标分析的 AI SQL 助手

2026年最新最优秀的AI SQL辅助工具排名揭晓!XIX.AI精心挑选了一系列功能强大的工具,这些工具会定期更新,并通过真实的场景测试来验证其性能。使用这些值得尝试的工具,您可以快速生成精准的收入分析报表、分析销售流程,并追踪产品各项指标,从而大幅提升工作效率。立即探索,找到最适合您的数据驱动决策工具!238个字符

9 个工具
xix.ai
音乐创作 最佳用于歌曲草稿的 AI 旋律创作工具
最佳用于歌曲草稿的 AI 旋律创作工具

2026 年最新最佳顶级评分 AI 旋律创作工具,助力歌曲草稿创作!XIX.AI 精心策划了一套极具影响力且经过严格真实世界测试的变革性合集,旨在提供最佳的创作体验。您可以找到详细的免费与付费版对比、精准的排名以及必试选项,这些工具旨在帮助您轻松创作出令人惊艳的歌曲草稿,并显著提升您的创意生产力。立即探索,发现您的完美工具!

8 个工具
xix.ai
评论 (0)
0/500
OR