LFM2.5 DSpark 草案模型發布:推論速度提升 3.18 倍
Liquid AI 與 Hugging Face 已正式發布 LFM2.5 系列的 DSpark 草案模型檢查點,涵蓋 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 及 LFM2.5-8B-A1B。 這項創新技術引入了一種嶄新的推測性解碼路徑,在維持輸出品質的同時,顯著提升了推論吞吐量。
關鍵效能提升與實際應用
實際測試證實了 DSpark 令人印象深刻的加速效果。在 GPU 上,吞吐量最高可提升 3.18 倍;而在邊緣裝置上,提升幅度則高達 2.87 倍。
在邊緣代理推論中,LFM2.5-2.6B 將函式呼叫延遲平均降低 57%。經 M4 Max MacBook Pro 測試,其速度可達每秒 139 個標記,不僅降低了本地代理部署的門檻,更提供了媲美專有雲端模型的使用者體驗。

理解 DSpark 的架構與運作機制
傳統的大型語言模型(LLM)推論受限於記憶體頻寬,因為大部分時間都花在將權重從 DRAM 串流傳輸至 SRAM 上。投機性解碼透過使用輕量級草稿模型來生成候選標記,再由目標模型在單次前向傳播中進行驗證,從而解決此問題,並有效分散權重載入的成本。
DSpark 透過三個核心元件整合現有方法:
平行骨幹網路:與 DFlash 類似,它基於目標模型的上下文特徵,在單次前向傳遞中為所有草稿標記生成隱藏狀態。序列化頭(馬爾可夫頭): 透過模擬相鄰標記之間的馬可夫鏈,強化依賴關係並提升後續位置的接受率。信心調度驗證器:預測每個標記的存活機率,當驗證成本高於節省的成本時,自動捨棄信心度低的後綴。在訓練方面,該草稿模型採用了包含 SFT、聊天、程式碼及函式呼叫等多元資料集的組合。經過嚴謹的剝離實驗後,初始版本採用了由 5 層和 9 個區塊組成的純注意力架構,參數數量維持在約 3 億左右。

品質保證與生態系統整合
由於採用推測性解碼,貪婪解碼僅接受與目標模型分佈完全匹配的草稿標記。被拒絕的標記將被目標模型的輸出取代,確保生成的序列與基準貪婪解碼結構一致,且在基準測試中不會造成準確度損失。
發布之際,DSpark 已實現與主流推論框架的相容性:
SGLang:透過專用的整合與啟動設定,支援在加速器上執行。llama.cpp:提供官方建置支援,讓使用者能透過命令列載入對應的 GGUF 權重與草稿模型檔案。
相關文章
為何 Abnormal AI 會與 OpenAI 在《Daybreak》節目中合作
OpenAI 網路安全產品主管 Michael Aiello | 圖片來源:Michael Aiello/LinkedInAbnormal AI 加入 OpenAI 的「Daybreak」計畫,麥可·艾耶洛表示,此次合作將加速企業採用實用的防禦措施領先的前沿人工智慧公司 OpenAI 已與 Abnormal AI 建立合作夥伴關係,協助企業在其業務及產品開發過程中,安全地運用頂尖的人工智慧模型。透
AI Agent Elements Claw 完成超導材料研發
隨著人工智慧不斷拓展科學探索的邊界,一項重要的里程碑已然達成。7月3日,阿里巴巴達摩院攜手中國人民大學與中國科學院大學,共同推出「Elements Claw」——全球首個專門用於發現超導材料的人工智慧代理。 這項突破標誌著科學發現領域的轉變,使人工智慧從輔助角色轉變為獨立的研究夥伴,同時為新材料開發建立了高效的自動化框架。傳統的超導體搜尋方法向來以速度緩慢著稱,且高度依賴試錯法。儘管像 Super
如何有效檢查 Google 日本和 Yahoo 日本的 SEO 排名
將肖像照片轉換為哈利·波特風格素描目錄:簡介將照片轉換為素描使用最小值濾鏡轉換肖像的另一種技術開始操作下載所需的影象準備圖層去色影象建立去色圖層調整圖層應用反相效果反相圖層新增顏色減淡效果模糊影象應用高斯模糊濾鏡調整模糊設定完善素描使用畫筆工具增強細節並去除瑕疵合併圖層合併反相圖層和背景副本圖層建立長條和短條圖層新增鉛筆筆觸在短條圖層上應用傾斜筆觸調整筆觸設定完成素描在長條圖層上應用傾斜筆觸調整筆觸長度調整圖層不透明度和混合模式結論
相關專題推薦
評論 (0)
0/500
Liquid AI 與 Hugging Face 已正式發布 LFM2.5 系列的 DSpark 草案模型檢查點,涵蓋 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 及 LFM2.5-8B-A1B。 這項創新技術引入了一種嶄新的推測性解碼路徑,在維持輸出品質的同時,顯著提升了推論吞吐量。
關鍵效能提升與實際應用
實際測試證實了 DSpark 令人印象深刻的加速效果。在 GPU 上,吞吐量最高可提升 3.18 倍;而在邊緣裝置上,提升幅度則高達 2.87 倍。
在邊緣代理推論中,LFM2.5-2.6B 將函式呼叫延遲平均降低 57%。經 M4 Max MacBook Pro 測試,其速度可達每秒 139 個標記,不僅降低了本地代理部署的門檻,更提供了媲美專有雲端模型的使用者體驗。

理解 DSpark 的架構與運作機制
傳統的大型語言模型(LLM)推論受限於記憶體頻寬,因為大部分時間都花在將權重從 DRAM 串流傳輸至 SRAM 上。投機性解碼透過使用輕量級草稿模型來生成候選標記,再由目標模型在單次前向傳播中進行驗證,從而解決此問題,並有效分散權重載入的成本。
DSpark 透過三個核心元件整合現有方法:
平行骨幹網路:與 DFlash 類似,它基於目標模型的上下文特徵,在單次前向傳遞中為所有草稿標記生成隱藏狀態。序列化頭(馬爾可夫頭): 透過模擬相鄰標記之間的馬可夫鏈,強化依賴關係並提升後續位置的接受率。信心調度驗證器:預測每個標記的存活機率,當驗證成本高於節省的成本時,自動捨棄信心度低的後綴。在訓練方面,該草稿模型採用了包含 SFT、聊天、程式碼及函式呼叫等多元資料集的組合。經過嚴謹的剝離實驗後,初始版本採用了由 5 層和 9 個區塊組成的純注意力架構,參數數量維持在約 3 億左右。

品質保證與生態系統整合
由於採用推測性解碼,貪婪解碼僅接受與目標模型分佈完全匹配的草稿標記。被拒絕的標記將被目標模型的輸出取代,確保生成的序列與基準貪婪解碼結構一致,且在基準測試中不會造成準確度損失。
發布之際,DSpark 已實現與主流推論框架的相容性:
SGLang:透過專用的整合與啟動設定,支援在加速器上執行。llama.cpp:提供官方建置支援,讓使用者能透過命令列載入對應的 GGUF 權重與草稿模型檔案。
為何 Abnormal AI 會與 OpenAI 在《Daybreak》節目中合作
OpenAI 網路安全產品主管 Michael Aiello | 圖片來源:Michael Aiello/LinkedInAbnormal AI 加入 OpenAI 的「Daybreak」計畫,麥可·艾耶洛表示,此次合作將加速企業採用實用的防禦措施領先的前沿人工智慧公司 OpenAI 已與 Abnormal AI 建立合作夥伴關係,協助企業在其業務及產品開發過程中,安全地運用頂尖的人工智慧模型。透
AI Agent Elements Claw 完成超導材料研發
隨著人工智慧不斷拓展科學探索的邊界,一項重要的里程碑已然達成。7月3日,阿里巴巴達摩院攜手中國人民大學與中國科學院大學,共同推出「Elements Claw」——全球首個專門用於發現超導材料的人工智慧代理。 這項突破標誌著科學發現領域的轉變,使人工智慧從輔助角色轉變為獨立的研究夥伴,同時為新材料開發建立了高效的自動化框架。傳統的超導體搜尋方法向來以速度緩慢著稱,且高度依賴試錯法。儘管像 Super
如何有效檢查 Google 日本和 Yahoo 日本的 SEO 排名
將肖像照片轉換為哈利·波特風格素描目錄:簡介將照片轉換為素描使用最小值濾鏡轉換肖像的另一種技術開始操作下載所需的影象準備圖層去色影象建立去色圖層調整圖層應用反相效果反相圖層新增顏色減淡效果模糊影象應用高斯模糊濾鏡調整模糊設定完善素描使用畫筆工具增強細節並去除瑕疵合併圖層合併反相圖層和背景副本圖層建立長條和短條圖層新增鉛筆筆觸在短條圖層上應用傾斜筆觸調整筆觸設定完成素描在長條圖層上應用傾斜筆觸調整筆觸長度調整圖層不透明度和混合模式結論





首頁






