DeepSeek 推出可與前沿系統匹敵的人工智慧模型

中國人工智慧實驗室 DeepSeek 已發布其最新大型語言模型 DeepSeek V4 的兩個預覽版本,這是對去年 V3.2 模型及其配套的 R1 推理模型的備受期待的更新,該模型曾在人工智慧界引起巨大迴響。
該公司表示,DeepSeek V4 Flash 與 V4 Pro 均屬專家混合模型,各自具備 100 萬個標記的上下文視窗——足以處理提示語中的龐大程式碼庫或文件。此專家混合方法會針對每項任務僅啟用特定參數子集,以降低推論成本。
Pro 模型擁有總計 1.6 兆個參數(其中 490 億個為活躍參數),使其成為目前規模最大的公開權重模型。其規模超越了 Moonshot AI 的 Kimi K 2.6(1.1 兆)、MiniMax 的 M1(4560 億)等競爭對手,並超過 DeepSeek V3.2(6710 億)的兩倍以上。 較小的 V4 Flash 模型則包含 2,840 億個參數(其中 130 億個為活躍參數)。
DeepSeek 聲稱,架構上的改進使這兩款新模型比 DeepSeek V3.2 更高效且性能更強,在推理基準測試上幾乎「縮小了差距」,無論是開源還是閉源的當前領先模型皆然。
該實驗室報告指出,其新款 V4-Pro-Max 模型在各類推理基準測試中表現優於同類開源模型,並在特定任務上超越 OpenAI 的 GPT-5.2 及 Gemini 3.0 Pro。在編碼競賽基準測試中,DeepSeek 表示兩款 V4 模型的表現「可與 GPT-5.4 相媲美」。
然而,在知識型評估中,這些模型似乎略遜於前沿模型,特別是與 OpenAI 的 GPT-5.4 以及最新的 Google Gemini 3.1 Pro 相比。該實驗室指出,此差距顯示其「發展軌跡落後於最先進的前沿模型約 3 至 6 個月」。
與許多支援音訊、影片及圖像生成的閉源同類模型不同,V4 Flash 和 V4 Pro 皆為純文字模型。
其關鍵優勢在於,DeepSeek V4 的成本效益遠高於當前前沿模型。較小的 V4 Flash 定價為每百萬輸入令牌 0.14 美元,每百萬輸出令牌 0.28 美元,價格低於 GPT-5.4 Nano、Gemini 3.1 Flash、GPT-5.4 Mini 及 Claude Haiku 4.5。 規模較大的 V4 Pro 模型每百萬輸入令牌收費 0.145 美元,每百萬輸出令牌收費 3.48 美元,其費率同樣低於 Gemini 3.1 Pro、GPT-5.5、Claude Opus 4.7 及 GPT-5.4。
此次發布緊接在美國指控中國利用數千個代理帳戶,對美國人工智慧實驗室進行工業規模的智慧財產權竊取事件的隔日。DeepSeek 自身也曾面臨 Anthropic 和 OpenAI 的指控,指其進行「提煉」(distilling),實質上是複製了這些公司的 AI 模型。
相關文章
美國因智慧財產權問題對中國人工智慧公司實施制裁
週二,美國財政部長斯科特·貝森特宣佈,美國政府將審查來自中國的大語言模型,以排查潛在的智慧財產權盜竊行為,並警告稱,若確認存在此類違規行為,將對中國的AI企業實施制裁。“我們聽到了很多關於開源模型興起並對美國的大語言模型構成威脅的討論,”貝森特週二在福克斯商業頻道表示。“本屆政府支援開源模型,但我們不支援智慧財產權盜竊。如果我們發現,尤其是海外模型正在竊取我們優秀企業的成果,我們有權因這種盜竊行為對其進行制裁。”貝森特的言論最初由彭博社報道。此番表態之際,中國模型——最近的是月之暗面(Moon
為什麼我忍不住要為這家小巧的開源 AI 開發商 Arcee 加油打氣
Arcee 是一家僅有 26 名員工的精簡型美國新創公司,該公司近日揭曉了其最新的推理模型「Trinity Large Thinking」——這款擁有 4,000 億參數的龐大開源大型語言模型(LLM),僅以 2,000 萬美元的有限預算開發而成。 執行長馬克·麥奎德(Mark McQuade)向《TechCrunch》表示,這是迄今為止由非中國企業所發布的、能力最強大的開放權重模型。Arcee
薩蒂亞·納德拉向使用人工智慧的企業發出嚴正警告
在圍繞人工智慧潛在缺點的諸多辯論中,有一項擔憂讓矽谷的人工智慧愛好者格外憂心:那些販售專有模型的主要人工智慧實驗室,其運作方式可能如同「特洛伊木馬」。人們擔憂的是,當新創公司和企業採用來自 OpenAI 和 Anthropic 等實驗室的人工智慧模型時,這些實驗室將能越來越多地接觸到企業最敏感的商業數據。 模型開發商隨後可能利用這些資訊謀取私利,甚至可能轉而成為自身客戶的競爭對手。針對此風險的警告
相關專題推薦
評論 (0)
0/500

中國人工智慧實驗室 DeepSeek 已發布其最新大型語言模型 DeepSeek V4 的兩個預覽版本,這是對去年 V3.2 模型及其配套的 R1 推理模型的備受期待的更新,該模型曾在人工智慧界引起巨大迴響。
該公司表示,DeepSeek V4 Flash 與 V4 Pro 均屬專家混合模型,各自具備 100 萬個標記的上下文視窗——足以處理提示語中的龐大程式碼庫或文件。此專家混合方法會針對每項任務僅啟用特定參數子集,以降低推論成本。
Pro 模型擁有總計 1.6 兆個參數(其中 490 億個為活躍參數),使其成為目前規模最大的公開權重模型。其規模超越了 Moonshot AI 的 Kimi K 2.6(1.1 兆)、MiniMax 的 M1(4560 億)等競爭對手,並超過 DeepSeek V3.2(6710 億)的兩倍以上。 較小的 V4 Flash 模型則包含 2,840 億個參數(其中 130 億個為活躍參數)。
DeepSeek 聲稱,架構上的改進使這兩款新模型比 DeepSeek V3.2 更高效且性能更強,在推理基準測試上幾乎「縮小了差距」,無論是開源還是閉源的當前領先模型皆然。
該實驗室報告指出,其新款 V4-Pro-Max 模型在各類推理基準測試中表現優於同類開源模型,並在特定任務上超越 OpenAI 的 GPT-5.2 及 Gemini 3.0 Pro。在編碼競賽基準測試中,DeepSeek 表示兩款 V4 模型的表現「可與 GPT-5.4 相媲美」。
然而,在知識型評估中,這些模型似乎略遜於前沿模型,特別是與 OpenAI 的 GPT-5.4 以及最新的 Google Gemini 3.1 Pro 相比。該實驗室指出,此差距顯示其「發展軌跡落後於最先進的前沿模型約 3 至 6 個月」。
與許多支援音訊、影片及圖像生成的閉源同類模型不同,V4 Flash 和 V4 Pro 皆為純文字模型。
其關鍵優勢在於,DeepSeek V4 的成本效益遠高於當前前沿模型。較小的 V4 Flash 定價為每百萬輸入令牌 0.14 美元,每百萬輸出令牌 0.28 美元,價格低於 GPT-5.4 Nano、Gemini 3.1 Flash、GPT-5.4 Mini 及 Claude Haiku 4.5。 規模較大的 V4 Pro 模型每百萬輸入令牌收費 0.145 美元,每百萬輸出令牌收費 3.48 美元,其費率同樣低於 Gemini 3.1 Pro、GPT-5.5、Claude Opus 4.7 及 GPT-5.4。
此次發布緊接在美國指控中國利用數千個代理帳戶,對美國人工智慧實驗室進行工業規模的智慧財產權竊取事件的隔日。DeepSeek 自身也曾面臨 Anthropic 和 OpenAI 的指控,指其進行「提煉」(distilling),實質上是複製了這些公司的 AI 模型。
美國因智慧財產權問題對中國人工智慧公司實施制裁
週二,美國財政部長斯科特·貝森特宣佈,美國政府將審查來自中國的大語言模型,以排查潛在的智慧財產權盜竊行為,並警告稱,若確認存在此類違規行為,將對中國的AI企業實施制裁。“我們聽到了很多關於開源模型興起並對美國的大語言模型構成威脅的討論,”貝森特週二在福克斯商業頻道表示。“本屆政府支援開源模型,但我們不支援智慧財產權盜竊。如果我們發現,尤其是海外模型正在竊取我們優秀企業的成果,我們有權因這種盜竊行為對其進行制裁。”貝森特的言論最初由彭博社報道。此番表態之際,中國模型——最近的是月之暗面(Moon
為什麼我忍不住要為這家小巧的開源 AI 開發商 Arcee 加油打氣
Arcee 是一家僅有 26 名員工的精簡型美國新創公司,該公司近日揭曉了其最新的推理模型「Trinity Large Thinking」——這款擁有 4,000 億參數的龐大開源大型語言模型(LLM),僅以 2,000 萬美元的有限預算開發而成。 執行長馬克·麥奎德(Mark McQuade)向《TechCrunch》表示,這是迄今為止由非中國企業所發布的、能力最強大的開放權重模型。Arcee
薩蒂亞·納德拉向使用人工智慧的企業發出嚴正警告
在圍繞人工智慧潛在缺點的諸多辯論中,有一項擔憂讓矽谷的人工智慧愛好者格外憂心:那些販售專有模型的主要人工智慧實驗室,其運作方式可能如同「特洛伊木馬」。人們擔憂的是,當新創公司和企業採用來自 OpenAI 和 Anthropic 等實驗室的人工智慧模型時,這些實驗室將能越來越多地接觸到企業最敏感的商業數據。 模型開發商隨後可能利用這些資訊謀取私利,甚至可能轉而成為自身客戶的競爭對手。針對此風險的警告





首頁






