DeepSeek V4 預計於四月中旬推出,具備兆級參數並支援國產晶片
DeepSeek 創辦人梁文峰近日在一份內部備忘錄中透露,該公司的下一代旗艦模型 DeepSeek V4 預計將於 2026 年 4 月底正式發布。這項公告標誌著在邁向兆參數規模的全球競賽中,國內大型語言模型迎來了一個關鍵時刻。 在 V4 發布之前,DeepSeek 已在其網頁平台上推出「快速模式」和「專家模式」,透過快速搜尋及處理複雜的多步驟查詢等差異化互動,讓使用者一窺其能力。

技術層面而言,DeepSeek V4 預計將實現重大飛躍,目標參數規模達一兆,並支援高達一百萬個標記的上下文視窗。其關鍵突破在於與華為昇騰系列晶片等國產硬體具備深層的原生相容性。此戰略性發展被視為中國 AI 產業減少對 CUDA 生態系統依賴、建立自主運算基礎的關鍵一步。 為因應此需求,包括阿里巴巴、字節跳動及騰訊在內的國內科技巨頭已大量訂購數十萬顆新型AI晶片,旨在透過其雲端服務快速整合V4。這股需求激增已導致近期AI晶片價格上漲約20%。
隨著 DeepSeek V4 的問世,大型模型領域的競爭正從純粹的演算法競賽,轉變為涵蓋「模型效能、運算能力及生態系發展」的全方位戰役。透過針對國內運算基礎設施進行優化,DeepSeek 不僅提升了模型推論的成本效益,更在當前的運算能力格局下,為本土大型模型的成長開闢了一條可持續的發展道路。
相關文章
科大訊飛釋出訊飛星火大模型 V2.5
9月1日,科大訊飛將開源兩款面向邊緣場景的大語言模型——星火X2.5-4B和星火X2.5-1.7B,據最新官方公告。這兩款模型原生支援高達100萬token的上下文視窗。它們在智慧體互動、數學推理和通用理解等關鍵領域實現了顯著提升,為車載系統、智慧裝置和物聯網生態等邊緣應用提供了強有力的支援。在上述邊緣模型釋出後,科大訊飛計劃於9月7日推出擁有2930億引數的星火X2.5基礎模型。該版本將進一步推進程式碼生成和多智慧體協作等核心技術。在公司2026年年中簡報會上宣佈,一款完全基於國產算力基礎設施
Meta 在使用者強烈反對後取消了 AI 照片編輯功能
Meta,這家社交媒體巨頭,再次捲入關於人工智慧與使用者隱私之間微妙平衡的公開辯論。據 TechCrunch 報道,Meta 的 Superintelligence Labs 本週早些時候推出了一款新的 AI 影象生成器 Muse Image。然而,一個備受好評的關鍵功能——允許使用者透過“@”符號標記來修改和生成來自公開 Instagram 賬戶的影象——由於缺乏適當的通知機制,立即引發了使用者以及 CAA 等機構的強烈反對。面對強烈的批評,Meta 迅速撤銷了該決定,並於週五透過部落格文章宣佈將
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
相關專題推薦
評論 (2)
0/500
Trillion parameters and domestic chip support? Sounds like they're finally trying to break free from Nvidia's grip. But how's the power consumption? Hope it doesn't turn into a space heater 🔥
DeepSeek 創辦人梁文峰近日在一份內部備忘錄中透露,該公司的下一代旗艦模型 DeepSeek V4 預計將於 2026 年 4 月底正式發布。這項公告標誌著在邁向兆參數規模的全球競賽中,國內大型語言模型迎來了一個關鍵時刻。 在 V4 發布之前,DeepSeek 已在其網頁平台上推出「快速模式」和「專家模式」,透過快速搜尋及處理複雜的多步驟查詢等差異化互動,讓使用者一窺其能力。

技術層面而言,DeepSeek V4 預計將實現重大飛躍,目標參數規模達一兆,並支援高達一百萬個標記的上下文視窗。其關鍵突破在於與華為昇騰系列晶片等國產硬體具備深層的原生相容性。此戰略性發展被視為中國 AI 產業減少對 CUDA 生態系統依賴、建立自主運算基礎的關鍵一步。 為因應此需求,包括阿里巴巴、字節跳動及騰訊在內的國內科技巨頭已大量訂購數十萬顆新型AI晶片,旨在透過其雲端服務快速整合V4。這股需求激增已導致近期AI晶片價格上漲約20%。
隨著 DeepSeek V4 的問世,大型模型領域的競爭正從純粹的演算法競賽,轉變為涵蓋「模型效能、運算能力及生態系發展」的全方位戰役。透過針對國內運算基礎設施進行優化,DeepSeek 不僅提升了模型推論的成本效益,更在當前的運算能力格局下,為本土大型模型的成長開闢了一條可持續的發展道路。
科大訊飛釋出訊飛星火大模型 V2.5
9月1日,科大訊飛將開源兩款面向邊緣場景的大語言模型——星火X2.5-4B和星火X2.5-1.7B,據最新官方公告。這兩款模型原生支援高達100萬token的上下文視窗。它們在智慧體互動、數學推理和通用理解等關鍵領域實現了顯著提升,為車載系統、智慧裝置和物聯網生態等邊緣應用提供了強有力的支援。在上述邊緣模型釋出後,科大訊飛計劃於9月7日推出擁有2930億引數的星火X2.5基礎模型。該版本將進一步推進程式碼生成和多智慧體協作等核心技術。在公司2026年年中簡報會上宣佈,一款完全基於國產算力基礎設施
Meta 在使用者強烈反對後取消了 AI 照片編輯功能
Meta,這家社交媒體巨頭,再次捲入關於人工智慧與使用者隱私之間微妙平衡的公開辯論。據 TechCrunch 報道,Meta 的 Superintelligence Labs 本週早些時候推出了一款新的 AI 影象生成器 Muse Image。然而,一個備受好評的關鍵功能——允許使用者透過“@”符號標記來修改和生成來自公開 Instagram 賬戶的影象——由於缺乏適當的通知機制,立即引發了使用者以及 CAA 等機構的強烈反對。面對強烈的批評,Meta 迅速撤銷了該決定,並於週五透過部落格文章宣佈將
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
Trillion parameters and domestic chip support? Sounds like they're finally trying to break free from Nvidia's grip. But how's the power consumption? Hope it doesn't turn into a space heater 🔥





首頁






