美國人工智慧模型與深度求索(DeepSeek)相似:效能更差,成本更高,但更符合美國合規要求

前OpenAI技術長Mustafa Suleyman的首個專案意外地翻轉了中美之間大語言模型開發的劇本。7月15日,他推出了Thinking Machines Lab併發布了其首款模型Inkling。該模型利用受DeepSeek-V3啟發的混合專家架構,並利用來自Moonshot的Kimi K2.5等開放模型的合成資料進行後訓練初始化,結果喜憂參半。在多個基準測試中,Inkling落後於Kimi和GLM,且定價明顯更高。儘管籌集了20億美元並實現了120億美元的估值,但首秀未達預期,然而Suleyman從一開始可能就沒打算躋身頂級行列。
審視硬體,Inkling匹配了明星實驗室的聲望。它採用具有9750億總引數的混合專家架構,每個令牌啟用410億引數。預訓練使用了45萬億個令牌,涵蓋文字、影象、音訊和影片,支援高達100萬個令牌的上下文。該模型處理文字、影象和音訊,輸出文字,同時允許調整推理強度以平衡效能、速度和成本。權重以寬鬆的Apache 2.0許可證釋出,開發者可以透過Thinking Machines的Tinker平臺自行部署或微調。策略很明確:Inkling不直接面向消費者,而是作為企業AI應用的基礎。
技術報告揭示了其架構中的一個關鍵細節。Thinking Machines明確表示,Inkling的混合專家設計遵循DeepSeek-V3,具有眾多專家模組,其中每個令牌僅啟用子集,以及DeepSeek-V3的無助手損失負載均衡。中國的影響延伸至訓練:後訓練開始於使用來自開放權重模型的合成資料進行監督微調,特別引用了Kimi K2.5。
一條清晰的路線圖浮現出來:由OpenAI前CTO創立的美國實驗室,其首款模型模仿了DeepSeek的架構,後訓練依賴於Kimi的資料。借鑑開放模型本身並非問題,因為DeepSeek和Kimi公開共享權重和使用許可權,建立在公共成就之上。更引人注目的是,儘管吸收了中文模型技術,Inkling未能超越其前輩。Thinking Machines坦率承認:Inkling目前不是最強的模型,無論是開源還是閉源。
數字凸顯了差距。在最終的人類考試純文字評估中,Inkling得分29.7%,而Kimi K2.6和GLM 5.2分別達到35.9%和40.1%。啟用工具後,Inkling升至46%,仍落後於Kimi K2.6的54%和GLM 5.2的54.7%。在SWE-Bench Pro中,測試真實的軟體工程能力,Inkling得分54.3%,而Kimi K2.6為58.6%,GLM 5.2為62.1%。差距在Terminal Bench 2.1中最為明顯,Inkling得分63.8%,而Kimi K2.6和GLM 5.2分別達到71.3%和82.7%。
Inkling在網路應用設計、音訊理解和安全評估方面表現出色,甚至在某些數學任務中優於Kimi和DeepSeek。然而,它尚未達到綜合推理、程式設計和代理能力的頂級行列。定價未提供任何緩解:在Tinker平臺上,64K版本每百萬預填充令牌收費1.87美元,每百萬取樣令牌收費4.68美元,這已經是五天的折扣價。256K版本分別收費3.74美元和9.36美元。與Kimi K2.6的API費率0.95美元輸入和4美元輸出,以及GLM 5.2的1.4美元和4.4美元相比,Inkling的預填充價格幾乎是Kimi K2.6的兩倍,生成成本更高且無明顯價格優勢。局勢微妙:架構參考DeepSeek,後訓練依賴Kimi,效能落後於中國領先的開放模型,且定價更高。
intrigue在於Thinking Machines獨特的背景。該公司類似於OpenAI校友網路——2025年2月推出,約30人的團隊中有三分之二來自OpenAI,其他人來自Meta和Mistral。創始成員包括John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,路透社報道Suleyman從其前僱主那裡招募了至少20名研究人員。
Suleyman於2018年加入OpenAI,參與DALL-E、Codex、ChatGPT和Sora的開發,於2022年成為CTO,並在Altman於2023年11月被解僱後短暫擔任臨時CEO。這個熟悉OpenAI發展和產品化的團隊離開以構建新的技術系統,導致外界期望一條受OpenAI啟發的路線。相反,主要技術來源指向中國模型,標誌著重大轉變:最瞭解OpenAI的人最終採用了中國模型的技術藍圖。
這一結論需要仔細分析。OpenAI最近的尖端模型是閉源的,阻止了外部訪問權重、架構或訓練計劃。即使Suleyman瞭解內部技術,他也不能將OpenAI的商業秘密轉移到新公司。相反,DeepSeek和Kimi已公開發布權重和技術報告,允許其架構、訓練方法和工具鏈被合法研究和重用。
Inkling是一個開放權重模型,對於構建開放生態系統的公司而言,採用來自DeepSeek和Kimi等開放模型的成熟解決方案是一個合乎邏輯的工程選擇。開發開放模型而忽視公開可用的中國成就將產生更高的試錯成本。因此,借鑑中國模型並不證明Suleyman認為DeepSeek超越OpenAI。開放性和參考條件的差異是明顯的,但訊號很清晰:中國模型已成為美國AI團隊在開放權重空間中的關鍵參考。
真正的問題是,為什麼Thinking Machines擁有現有的架構和訓練經驗,卻產生了效能更弱且價格更高的Inkling。Suleyman擁有頂級團隊、充足資金和最新的NVIDIA訓練系統。沒有理由忽視這些差距,表明高成本替代方案可能是經過計算的決定。
考慮到Thinking Machines的待遇,Inkling應該不僅僅是一個不錯的模型。2025年7月,該公司在釋出任何產品之前完成了20億美元的種子輪融資,估值120億美元,投資者包括a16z、NVIDIA、AMD和Sequoia。四個月後,談判旨在達到高達5000億美元的估值,將該公司定位為OpenAI和Anthropic的潛在競爭對手。釋出一款表現落後於中國模型且成本更高的產品未達預期。然而,從商業角度來看,Suleyman可能從未打算贏得基準測試。
公司強調開放權重、多模態性和可定製性,鼓勵企業使用Tinker將Inkling微調為針對客戶服務、編碼和行業代理的專業模型。Suleyman押注於一個不優先考慮基準排名的市場。企業更關心私有部署、資料控制以及根據業務需求進行持續訓練。這些需求中的很大一部分由中國開放模型滿足:OpenAI和Anthropic仍然是閉源的,而在Meta的Llama4表現不佳後,它減少了開源工作。與此同時,DeepSeek、Kimi、Qwen和GLM不斷髮布權重,效能接近美國閉源模型,但價格低得多。
美國企業迅速做出回應——根據CNBC提供的OpenRouter資料,自2026年2月以來,美國企業透過該平臺呼叫的令牌中中國模型的周份額已超過30%,達到46%,而2025年上半年平均為4.5%。Cursor為Composer2測試了多個基礎模型,最終選擇Kimi K2.5,因為其評估強勁。Bridgewater Fund透過Tinker微調了Alibaba的Qwen,取得了比一些頂級閉源模型更好的結果。中國開放模型已成為美國企業的省錢捷徑,但這條路徑現在面臨壓力。
同時,美國對中國AI模型的監管氛圍正在收緊。相關部門已發出關於資料安全、模型來源和供應鏈風險的警告,一些使用中國模型的公司面臨調查。即使沒有統一限制,政策不確定性也影響企業選擇,特別是那些處理政府業務和敏感資料的企業。
這為Inkling創造了市場空間:一家美國公司的開放權重模型,使用Apache 2.0許可證,支援私有部署和定製。美國企業選擇它,無需擔心使用中國模型帶來的政治爭議,使其更容易透過政府客戶和大型企業的合規審查。Inkling的真正價值在於這種合規確定性——Suleyman將DeepSeek和Kimi的公共成就轉化為由美國公司提供的模型。它不需要在基準測試中擊敗中國模型,只需成為猶豫繼續使用中國模型的美國企業的可接受選擇。這解釋了其較高的定價:政策縮小了競爭範圍,使得效能和價格差距變得不那麼重要。對於某些美國企業來說,一款稍弱且更昂貴的模型就足夠了。
相關文章
Meta 在使用者強烈反對後取消了 AI 照片編輯功能
Meta,這家社交媒體巨頭,再次捲入關於人工智慧與使用者隱私之間微妙平衡的公開辯論。據 TechCrunch 報道,Meta 的 Superintelligence Labs 本週早些時候推出了一款新的 AI 影象生成器 Muse Image。然而,一個備受好評的關鍵功能——允許使用者透過“@”符號標記來修改和生成來自公開 Instagram 賬戶的影象——由於缺乏適當的通知機制,立即引發了使用者以及 CAA 等機構的強烈反對。面對強烈的批評,Meta 迅速撤銷了該決定,並於週五透過部落格文章宣佈將
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
相關專題推薦
評論 (0)
0/500

前OpenAI技術長Mustafa Suleyman的首個專案意外地翻轉了中美之間大語言模型開發的劇本。7月15日,他推出了Thinking Machines Lab併發布了其首款模型Inkling。該模型利用受DeepSeek-V3啟發的混合專家架構,並利用來自Moonshot的Kimi K2.5等開放模型的合成資料進行後訓練初始化,結果喜憂參半。在多個基準測試中,Inkling落後於Kimi和GLM,且定價明顯更高。儘管籌集了20億美元並實現了120億美元的估值,但首秀未達預期,然而Suleyman從一開始可能就沒打算躋身頂級行列。
審視硬體,Inkling匹配了明星實驗室的聲望。它採用具有9750億總引數的混合專家架構,每個令牌啟用410億引數。預訓練使用了45萬億個令牌,涵蓋文字、影象、音訊和影片,支援高達100萬個令牌的上下文。該模型處理文字、影象和音訊,輸出文字,同時允許調整推理強度以平衡效能、速度和成本。權重以寬鬆的Apache 2.0許可證釋出,開發者可以透過Thinking Machines的Tinker平臺自行部署或微調。策略很明確:Inkling不直接面向消費者,而是作為企業AI應用的基礎。
技術報告揭示了其架構中的一個關鍵細節。Thinking Machines明確表示,Inkling的混合專家設計遵循DeepSeek-V3,具有眾多專家模組,其中每個令牌僅啟用子集,以及DeepSeek-V3的無助手損失負載均衡。中國的影響延伸至訓練:後訓練開始於使用來自開放權重模型的合成資料進行監督微調,特別引用了Kimi K2.5。
一條清晰的路線圖浮現出來:由OpenAI前CTO創立的美國實驗室,其首款模型模仿了DeepSeek的架構,後訓練依賴於Kimi的資料。借鑑開放模型本身並非問題,因為DeepSeek和Kimi公開共享權重和使用許可權,建立在公共成就之上。更引人注目的是,儘管吸收了中文模型技術,Inkling未能超越其前輩。Thinking Machines坦率承認:Inkling目前不是最強的模型,無論是開源還是閉源。
數字凸顯了差距。在最終的人類考試純文字評估中,Inkling得分29.7%,而Kimi K2.6和GLM 5.2分別達到35.9%和40.1%。啟用工具後,Inkling升至46%,仍落後於Kimi K2.6的54%和GLM 5.2的54.7%。在SWE-Bench Pro中,測試真實的軟體工程能力,Inkling得分54.3%,而Kimi K2.6為58.6%,GLM 5.2為62.1%。差距在Terminal Bench 2.1中最為明顯,Inkling得分63.8%,而Kimi K2.6和GLM 5.2分別達到71.3%和82.7%。
Inkling在網路應用設計、音訊理解和安全評估方面表現出色,甚至在某些數學任務中優於Kimi和DeepSeek。然而,它尚未達到綜合推理、程式設計和代理能力的頂級行列。定價未提供任何緩解:在Tinker平臺上,64K版本每百萬預填充令牌收費1.87美元,每百萬取樣令牌收費4.68美元,這已經是五天的折扣價。256K版本分別收費3.74美元和9.36美元。與Kimi K2.6的API費率0.95美元輸入和4美元輸出,以及GLM 5.2的1.4美元和4.4美元相比,Inkling的預填充價格幾乎是Kimi K2.6的兩倍,生成成本更高且無明顯價格優勢。局勢微妙:架構參考DeepSeek,後訓練依賴Kimi,效能落後於中國領先的開放模型,且定價更高。
intrigue在於Thinking Machines獨特的背景。該公司類似於OpenAI校友網路——2025年2月推出,約30人的團隊中有三分之二來自OpenAI,其他人來自Meta和Mistral。創始成員包括John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,路透社報道Suleyman從其前僱主那裡招募了至少20名研究人員。
Suleyman於2018年加入OpenAI,參與DALL-E、Codex、ChatGPT和Sora的開發,於2022年成為CTO,並在Altman於2023年11月被解僱後短暫擔任臨時CEO。這個熟悉OpenAI發展和產品化的團隊離開以構建新的技術系統,導致外界期望一條受OpenAI啟發的路線。相反,主要技術來源指向中國模型,標誌著重大轉變:最瞭解OpenAI的人最終採用了中國模型的技術藍圖。
這一結論需要仔細分析。OpenAI最近的尖端模型是閉源的,阻止了外部訪問權重、架構或訓練計劃。即使Suleyman瞭解內部技術,他也不能將OpenAI的商業秘密轉移到新公司。相反,DeepSeek和Kimi已公開發布權重和技術報告,允許其架構、訓練方法和工具鏈被合法研究和重用。
Inkling是一個開放權重模型,對於構建開放生態系統的公司而言,採用來自DeepSeek和Kimi等開放模型的成熟解決方案是一個合乎邏輯的工程選擇。開發開放模型而忽視公開可用的中國成就將產生更高的試錯成本。因此,借鑑中國模型並不證明Suleyman認為DeepSeek超越OpenAI。開放性和參考條件的差異是明顯的,但訊號很清晰:中國模型已成為美國AI團隊在開放權重空間中的關鍵參考。
真正的問題是,為什麼Thinking Machines擁有現有的架構和訓練經驗,卻產生了效能更弱且價格更高的Inkling。Suleyman擁有頂級團隊、充足資金和最新的NVIDIA訓練系統。沒有理由忽視這些差距,表明高成本替代方案可能是經過計算的決定。
考慮到Thinking Machines的待遇,Inkling應該不僅僅是一個不錯的模型。2025年7月,該公司在釋出任何產品之前完成了20億美元的種子輪融資,估值120億美元,投資者包括a16z、NVIDIA、AMD和Sequoia。四個月後,談判旨在達到高達5000億美元的估值,將該公司定位為OpenAI和Anthropic的潛在競爭對手。釋出一款表現落後於中國模型且成本更高的產品未達預期。然而,從商業角度來看,Suleyman可能從未打算贏得基準測試。
公司強調開放權重、多模態性和可定製性,鼓勵企業使用Tinker將Inkling微調為針對客戶服務、編碼和行業代理的專業模型。Suleyman押注於一個不優先考慮基準排名的市場。企業更關心私有部署、資料控制以及根據業務需求進行持續訓練。這些需求中的很大一部分由中國開放模型滿足:OpenAI和Anthropic仍然是閉源的,而在Meta的Llama4表現不佳後,它減少了開源工作。與此同時,DeepSeek、Kimi、Qwen和GLM不斷髮布權重,效能接近美國閉源模型,但價格低得多。
美國企業迅速做出回應——根據CNBC提供的OpenRouter資料,自2026年2月以來,美國企業透過該平臺呼叫的令牌中中國模型的周份額已超過30%,達到46%,而2025年上半年平均為4.5%。Cursor為Composer2測試了多個基礎模型,最終選擇Kimi K2.5,因為其評估強勁。Bridgewater Fund透過Tinker微調了Alibaba的Qwen,取得了比一些頂級閉源模型更好的結果。中國開放模型已成為美國企業的省錢捷徑,但這條路徑現在面臨壓力。
同時,美國對中國AI模型的監管氛圍正在收緊。相關部門已發出關於資料安全、模型來源和供應鏈風險的警告,一些使用中國模型的公司面臨調查。即使沒有統一限制,政策不確定性也影響企業選擇,特別是那些處理政府業務和敏感資料的企業。
這為Inkling創造了市場空間:一家美國公司的開放權重模型,使用Apache 2.0許可證,支援私有部署和定製。美國企業選擇它,無需擔心使用中國模型帶來的政治爭議,使其更容易透過政府客戶和大型企業的合規審查。Inkling的真正價值在於這種合規確定性——Suleyman將DeepSeek和Kimi的公共成就轉化為由美國公司提供的模型。它不需要在基準測試中擊敗中國模型,只需成為猶豫繼續使用中國模型的美國企業的可接受選擇。這解釋了其較高的定價:政策縮小了競爭範圍,使得效能和價格差距變得不那麼重要。對於某些美國企業來說,一款稍弱且更昂貴的模型就足夠了。
Meta 在使用者強烈反對後取消了 AI 照片編輯功能
Meta,這家社交媒體巨頭,再次捲入關於人工智慧與使用者隱私之間微妙平衡的公開辯論。據 TechCrunch 報道,Meta 的 Superintelligence Labs 本週早些時候推出了一款新的 AI 影象生成器 Muse Image。然而,一個備受好評的關鍵功能——允許使用者透過“@”符號標記來修改和生成來自公開 Instagram 賬戶的影象——由於缺乏適當的通知機制,立即引發了使用者以及 CAA 等機構的強烈反對。面對強烈的批評,Meta 迅速撤銷了該決定,並於週五透過部落格文章宣佈將
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






