選項
首頁
新聞
美國人工智慧模型與深度求索(DeepSeek)相似:效能更差,成本更高,但更符合美國合規要求

美國人工智慧模型與深度求索(DeepSeek)相似:效能更差,成本更高,但更符合美國合規要求

2026-09-03
42

美國人工智慧模型與深度求索(DeepSeek)相似:效能更差,成本更高,但更符合美國合規要求

前OpenAI技術長Mustafa Suleyman的首個專案意外地翻轉了中美之間大語言模型開發的劇本。7月15日,他推出了Thinking Machines Lab併發布了其首款模型Inkling。該模型利用受DeepSeek-V3啟發的混合專家架構,並利用來自Moonshot的Kimi K2.5等開放模型的合成資料進行後訓練初始化,結果喜憂參半。在多個基準測試中,Inkling落後於Kimi和GLM,且定價明顯更高。儘管籌集了20億美元並實現了120億美元的估值,但首秀未達預期,然而Suleyman從一開始可能就沒打算躋身頂級行列。

審視硬體,Inkling匹配了明星實驗室的聲望。它採用具有9750億總引數的混合專家架構,每個令牌啟用410億引數。預訓練使用了45萬億個令牌,涵蓋文字、影象、音訊和影片,支援高達100萬個令牌的上下文。該模型處理文字、影象和音訊,輸出文字,同時允許調整推理強度以平衡效能、速度和成本。權重以寬鬆的Apache 2.0許可證釋出,開發者可以透過Thinking Machines的Tinker平臺自行部署或微調。策略很明確:Inkling不直接面向消費者,而是作為企業AI應用的基礎。

技術報告揭示了其架構中的一個關鍵細節。Thinking Machines明確表示,Inkling的混合專家設計遵循DeepSeek-V3,具有眾多專家模組,其中每個令牌僅啟用子集,以及DeepSeek-V3的無助手損失負載均衡。中國的影響延伸至訓練:後訓練開始於使用來自開放權重模型的合成資料進行監督微調,特別引用了Kimi K2.5。

一條清晰的路線圖浮現出來:由OpenAI前CTO創立的美國實驗室,其首款模型模仿了DeepSeek的架構,後訓練依賴於Kimi的資料。借鑑開放模型本身並非問題,因為DeepSeek和Kimi公開共享權重和使用許可權,建立在公共成就之上。更引人注目的是,儘管吸收了中文模型技術,Inkling未能超越其前輩。Thinking Machines坦率承認:Inkling目前不是最強的模型,無論是開源還是閉源。

數字凸顯了差距。在最終的人類考試純文字評估中,Inkling得分29.7%,而Kimi K2.6和GLM 5.2分別達到35.9%和40.1%。啟用工具後,Inkling升至46%,仍落後於Kimi K2.6的54%和GLM 5.2的54.7%。在SWE-Bench Pro中,測試真實的軟體工程能力,Inkling得分54.3%,而Kimi K2.6為58.6%,GLM 5.2為62.1%。差距在Terminal Bench 2.1中最為明顯,Inkling得分63.8%,而Kimi K2.6和GLM 5.2分別達到71.3%和82.7%。

Inkling在網路應用設計、音訊理解和安全評估方面表現出色,甚至在某些數學任務中優於Kimi和DeepSeek。然而,它尚未達到綜合推理、程式設計和代理能力的頂級行列。定價未提供任何緩解:在Tinker平臺上,64K版本每百萬預填充令牌收費1.87美元,每百萬取樣令牌收費4.68美元,這已經是五天的折扣價。256K版本分別收費3.74美元和9.36美元。與Kimi K2.6的API費率0.95美元輸入和4美元輸出,以及GLM 5.2的1.4美元和4.4美元相比,Inkling的預填充價格幾乎是Kimi K2.6的兩倍,生成成本更高且無明顯價格優勢。局勢微妙:架構參考DeepSeek,後訓練依賴Kimi,效能落後於中國領先的開放模型,且定價更高。

intrigue在於Thinking Machines獨特的背景。該公司類似於OpenAI校友網路——2025年2月推出,約30人的團隊中有三分之二來自OpenAI,其他人來自Meta和Mistral。創始成員包括John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,路透社報道Suleyman從其前僱主那裡招募了至少20名研究人員。

Suleyman於2018年加入OpenAI,參與DALL-E、Codex、ChatGPT和Sora的開發,於2022年成為CTO,並在Altman於2023年11月被解僱後短暫擔任臨時CEO。這個熟悉OpenAI發展和產品化的團隊離開以構建新的技術系統,導致外界期望一條受OpenAI啟發的路線。相反,主要技術來源指向中國模型,標誌著重大轉變:最瞭解OpenAI的人最終採用了中國模型的技術藍圖。

這一結論需要仔細分析。OpenAI最近的尖端模型是閉源的,阻止了外部訪問權重、架構或訓練計劃。即使Suleyman瞭解內部技術,他也不能將OpenAI的商業秘密轉移到新公司。相反,DeepSeek和Kimi已公開發布權重和技術報告,允許其架構、訓練方法和工具鏈被合法研究和重用。

Inkling是一個開放權重模型,對於構建開放生態系統的公司而言,採用來自DeepSeek和Kimi等開放模型的成熟解決方案是一個合乎邏輯的工程選擇。開發開放模型而忽視公開可用的中國成就將產生更高的試錯成本。因此,借鑑中國模型並不證明Suleyman認為DeepSeek超越OpenAI。開放性和參考條件的差異是明顯的,但訊號很清晰:中國模型已成為美國AI團隊在開放權重空間中的關鍵參考。

真正的問題是,為什麼Thinking Machines擁有現有的架構和訓練經驗,卻產生了效能更弱且價格更高的Inkling。Suleyman擁有頂級團隊、充足資金和最新的NVIDIA訓練系統。沒有理由忽視這些差距,表明高成本替代方案可能是經過計算的決定。

考慮到Thinking Machines的待遇,Inkling應該不僅僅是一個不錯的模型。2025年7月,該公司在釋出任何產品之前完成了20億美元的種子輪融資,估值120億美元,投資者包括a16z、NVIDIA、AMD和Sequoia。四個月後,談判旨在達到高達5000億美元的估值,將該公司定位為OpenAI和Anthropic的潛在競爭對手。釋出一款表現落後於中國模型且成本更高的產品未達預期。然而,從商業角度來看,Suleyman可能從未打算贏得基準測試。

公司強調開放權重、多模態性和可定製性,鼓勵企業使用Tinker將Inkling微調為針對客戶服務、編碼和行業代理的專業模型。Suleyman押注於一個不優先考慮基準排名的市場。企業更關心私有部署、資料控制以及根據業務需求進行持續訓練。這些需求中的很大一部分由中國開放模型滿足:OpenAI和Anthropic仍然是閉源的,而在Meta的Llama4表現不佳後,它減少了開源工作。與此同時,DeepSeek、Kimi、Qwen和GLM不斷髮布權重,效能接近美國閉源模型,但價格低得多。

美國企業迅速做出回應——根據CNBC提供的OpenRouter資料,自2026年2月以來,美國企業透過該平臺呼叫的令牌中中國模型的周份額已超過30%,達到46%,而2025年上半年平均為4.5%。Cursor為Composer2測試了多個基礎模型,最終選擇Kimi K2.5,因為其評估強勁。Bridgewater Fund透過Tinker微調了Alibaba的Qwen,取得了比一些頂級閉源模型更好的結果。中國開放模型已成為美國企業的省錢捷徑,但這條路徑現在面臨壓力。

同時,美國對中國AI模型的監管氛圍正在收緊。相關部門已發出關於資料安全、模型來源和供應鏈風險的警告,一些使用中國模型的公司面臨調查。即使沒有統一限制,政策不確定性也影響企業選擇,特別是那些處理政府業務和敏感資料的企業。

這為Inkling創造了市場空間:一家美國公司的開放權重模型,使用Apache 2.0許可證,支援私有部署和定製。美國企業選擇它,無需擔心使用中國模型帶來的政治爭議,使其更容易透過政府客戶和大型企業的合規審查。Inkling的真正價值在於這種合規確定性——Suleyman將DeepSeek和Kimi的公共成就轉化為由美國公司提供的模型。它不需要在基準測試中擊敗中國模型,只需成為猶豫繼續使用中國模型的美國企業的可接受選擇。這解釋了其較高的定價:政策縮小了競爭範圍,使得效能和價格差距變得不那麼重要。對於某些美國企業來說,一款稍弱且更昂貴的模型就足夠了。

相關文章
Meta 在使用者強烈反對後取消了 AI 照片編輯功能 Meta 在使用者強烈反對後取消了 AI 照片編輯功能 Meta,這家社交媒體巨頭,再次捲入關於人工智慧與使用者隱私之間微妙平衡的公開辯論。據 TechCrunch 報道,Meta 的 Superintelligence Labs 本週早些時候推出了一款新的 AI 影象生成器 Muse Image。然而,一個備受好評的關鍵功能——允許使用者透過“@”符號標記來修改和生成來自公開 Instagram 賬戶的影象——由於缺乏適當的通知機制,立即引發了使用者以及 CAA 等機構的強烈反對。面對強烈的批評,Meta 迅速撤銷了該決定,並於週五透過部落格文章宣佈將
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。 DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。 Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額 儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額 儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
相關專題推薦
視頻創作 適用於 Reels、Shorts 及產品上市活動的 AI 短影片吸睛開場生成器
適用於 Reels、Shorts 及產品上市活動的 AI 短影片吸睛開場生成器

2026 年最新最佳 AI 短影片開場白生成器,適用於 Reels、Shorts 及產品上市活動!XIX.AI 嚴選備受好評、功能強大且能顛覆遊戲規則的工具,這些工具皆經過實際測試,能帶來絕對值得一試的成果。本頁面每週更新,提供免費與付費版本的比較排行榜,助您找到提升內容創意與生產力的完美解決方案。 立即探索,釋放您的 AI 競爭優勢!

11 個工具
xix.ai
寫作 適用於長篇寫作的 AI 文章大綱工具
適用於長篇寫作的 AI 文章大綱工具

2026 年最新、最受好評的長文寫作 AI 大綱工具!這份精選清單收錄了強大且具顛覆性的工具,能透過實際測試生成精準、結構化的大綱,大幅提升寫作效率。XIX.AI 正是這份菁英名單中的一員。 獲取免費版與付費版的比較指南,助您挑選最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
聊天機器人 用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用
用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用

2026 年最新最佳頂級評分 AI 角色扮演聊天應用,用於語言練習、面試準備和日常流利度!XIX.AI 精心策劃了一個強大的變革性合集,提供免費與付費對比、真實世界測試以及每週更新的排名。這些必試工具可幫助您提升寫作技能,克服流利度挑戰,並提高所有日常場景下的溝通效率。立即探索,發現您語言成長的完美工具!

10 個工具
xix.ai
音樂創作 用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具
用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具

2026年最新、最優秀且評分最高的AI音軌分離工具彙總,專為混音製作、取樣準備以及卡拉OK音訊處理而設計。這些功能強大的創新工具經過實際測試,能夠實現精準的音訊分離,顯著提升工作效率。XIX.AI每週都會更新免費的付費產品對比指南,幫助您找到最適合自身需求的工具。立即探索,發揮您的AI優勢。

8 個工具
xix.ai
數據分析 用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手
用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手

2026年最新最優秀的AI SQL輔助工具排名揭曉!XIX.AI精心挑選了一系列功能強大的工具,這些工具會定期更新,並透過真實的場景測試來驗證其效能。使用這些值得嘗試的工具,您可以快速生成精準的收入分析報表、分析銷售流程,並追蹤產品各項指標,從而大幅提升工作效率。立即探索,找到最適合您的資料驅動決策工具!238個字元

9 個工具
xix.ai
音樂創作 最佳用於歌曲草稿的 AI 旋律創作工具
最佳用於歌曲草稿的 AI 旋律創作工具

2026 年最新最佳頂級評分 AI 旋律創作工具,助力歌曲草稿創作!XIX.AI 精心策劃了一套極具影響力且經過嚴格真實世界測試的變革性合集,旨在提供最佳的創作體驗。您可以找到詳細的免費與付費版對比、精準的排名以及必試選項,這些工具旨在幫助您輕鬆創作出令人驚豔的歌曲草稿,並顯著提升您的創意生產力。立即探索,發現您的完美工具!

8 個工具
xix.ai
評論 (0)
0/500
OR