236B
模型參數數量
DeepSeek
附屬組織
開源
許可證類型
2024-05-06
發佈時間
模型簡介
DeepSeek-V2 是一種強大的混合專家模型(MoE),以其經濟的訓練和高效的推理能力著稱。它總共有2360億個參數,每次生成每個標記時激活其中的210億個參數。與DeepSeek 67B相比,DeepSeek-V2 性能更強,同時節省了42.5%的訓練成本,將KV緩存減少93.3%,並將最大生成吞吐量提高到5.76倍。
向左向右滑動以查看更多
語言理解能力
通常會做出語義錯誤的判斷,從而導致響應中明顯的邏輯斷開連接。
5.0
知識覆蓋範圍
具有重要的知識盲點,經常顯示事實錯誤並重複過時的信息。
6.3
推理能力
無法維持連貫的推理鏈,通常會導致因果關係或錯誤估計。
4.1
模型比較
相關模型
DeepSeek-V4-Flash
DeepSeek-V4-Flash 是 DeepSeek 專為低延遲互動、高並發使用及日常智慧應用所設計的、以效率為導向的輕量級模型。
DeepSeek-V4-Pro
DeepSeek-V4-Pro 是 DeepSeek 的旗艦級高效能模型,它在推理能力、程式設計能力、長文字處理能力以及整體任務處理效能方面都得到了進一步提升。
DeepSeek-V3.2
Deepseek V3系列模型的最新版本。
DeepSeek-V3.2-Exp
Deepseek V3 系列機型的最新實驗版本。
DeepSeek-R1-0528
最新版本的 Deepseek R1。
相關文件
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長
Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強
印度軟體巨頭縮減招聘,承諾隨著 AI 代理規模擴大不裁員
隨著人工智慧重塑傳統的勞動密集型商業模式,印度領先的軟體外包公司塔塔諮詢服務公司(TCS)公佈了其戰略應對措施。在週二的年度股東大會上,董事長概述了人機協作的願景,並澄清了公司在人工智慧時代的人力資源戰略。不裁員,但招聘將放緩TCS董事長明確表示,公司沒有因採用人工智慧而裁員的計劃,儘管整體招聘速度將放緩。雖然TCS此前減少了超過10,000名員工,但官員們強調,公司現在更傾向於透過自然流失來最佳化其人員結構,而非突然裁員。高層管理人員指出,以前由人類處理的重複性、機械性任務正不可避免地轉向
中國在全國高考期間鎖定人工智慧模型,以阻止即時作業輔導
隨著2026年高考臨近,關於考試期間暫停使用AI工具的謠言引發了激烈的網路爭論。針對公眾關切,各大AI平臺和教育應用澄清了立場:並非全面禁止,而是對考試相關功能實施有針對性的“限時鎖定”。這些平臺採用了精確的基於時間的控制機制。在官方考試時間內,如拍照解題和題目分析等功能將被暫時禁用。然而,日常對話功能和一般生活類查詢對使用者完全開放。這種有針對性的做法並非沒有先例。去年,幾個AI平臺在高考期間引入了類似的限制措施。業內人士指出,這些措施旨在符合監管標準,即禁止使用深度合成服務從事損害公共利益
調查顯示,一款經美國食品藥物管理局(FDA)核准的乳癌人工智慧診斷工具,其表現未達放射科醫師的預期
加州大學聖地牙哥分校健康中心的研究人員近期在《臨床影像》(Clinical Imaging)期刊上發表了一項研究,該研究針對美國乳房影像學會的 215 名會員進行了問卷調查。 研究結果顯示,用於乳癌檢測的人工智慧工具在臨床環境中的表現未達放射科醫師的預期。儘管近半數受訪者已每日使用經美國食品藥物管理局(FDA)核准的人工智慧診斷工具,且有 11% 計畫採用此類工具,但多數醫師僅將這些工具視為「第二
Ant Brain 全棧 2.0 於 WAIC 首度亮相,透過統一智慧驅動智慧藥局
2026年世界人工智慧大會(WAIC)將於7月17日揭開序幕,備受矚目的「展會瑰寶」獎項將成為本次大會的焦點。 今年的十大入圍作品展現了多項開創性創新成果,包括螞蟻集團的「基於螞蟻凌波跨實體具身大型模型的機器人智能藥房」以及思科科技的「神武8000 - 國產萬卡級AI超級叢集」等項目,以及其他尖端技術突破。「展會瑰寶」獎由大會組委會根據技術深度、市場潛力、可擴展性及社會影響力進行遴選,旨在表彰對產





首頁
