AMD 推出 vLLM-ATOM 外掛程式,以加速大型模型的推論

近期,AMD 正式推出了一款名為vLLM-ATOM 的新外掛程式。其核心目標是在不改變現有工作流程的前提下,充分釋放硬體潛力,為 DeepSeek-R1、Kimi-K2 及 gpt-oss-120B 等主流大型語言模型帶來顯著的推論速度提升。
對開發者而言,vLLM是一個開源框架,旨在優化高並發環境下的吞吐量與 GPU 記憶體使用效率。與傳統的單請求工具不同,它著重於請求調度與快取管理。 AMD 的新款 ATOM 外掛程式是一項專為Instinct GPU 打造的深度客製化解決方案。其突出特點在於「無縫遷移」:企業用戶無需修改現有的 API 介面、指令或端到端工作流程;該外掛程式會自動在後台處理底層的效能優化。
從技術架構角度來看,vLLM-ATOM 採用精確的三層設計。最上層保留了 vLLM 的請求調度與相容性介面;中間層(即 ATOM 外掛程式)負責管理模型實作與核心優化; 底層的AITER 則直接連接到 GPU 硬體,提供諸如 Flash Attention、量化 GEMM 以及融合 MoE 等核心加速功能。
此外掛程式主要針對Instinct MI350、MI400 及 MI355X 等高效能 GPU 運算卡。 其支援清單涵蓋 Qwen3、GLM 和 DeepSeek 等旗艦模型,並全面支援各種架構,包括 MoE(專家混合模型)、密集模型以及視覺語言模型(VLM)。
業界分析師指出,此解決方案的核心價值在於大幅降低高效能運算的部署門檻。透過這種無需學習曲線、平滑遷移的方法,企業能更輕鬆地將 AI 服務遷移至 AMD 硬體後端,在維持推論效率的同時,有效提升大型模型線上服務的穩定性與響應速度。
相關文章
亞馬遜運用人工智慧與潔淨能源推動資料中心擴建
亞馬遜運用人工智慧、核能及電動車,在擴展基礎設施的同時降低碳強度。圖片來源:亞馬遜亞馬遜的《2025年永續發展報告》詳述了這家科技巨頭如何整合人工智慧與核能投資,在擴展全球基礎設施的同時降低碳排放。根據亞馬遜《2025年永續發展報告》,該公司全球營運所消耗的電力已連續第三年100%由再生能源供應。該公司透過其零碳能源組合實現此目標,該組合包含 712 個專案,總容量達 42GW,以支援資料中心的全
阿里雲百鍊推出免費多模型切換功能,整合Qwen3.5與GLM-5
技術服務商正在積極拆解大模型時代的“全家桶”捆綁策略。2026年2月25日,36氪報道,阿里雲旗下大模型服務平臺“百鍊”正式推出全新程式設計計劃。該舉措透過API服務將中國四大頂級開源模型整合於一套方案中。這一戰略舉措將阿里雲定位為全球首家提供“多模型無縫且免費切換”的雲服務提供商,有效消除了開發者此前在不同模型API之間切換時面臨的摩擦。核心亮點:四大“神獸”齊聚百鍊該程式設計計劃首批引入了當前最具競爭力的四款開源模型:Qwen3.5(通義千問):阿里雲自研模型,憑藉強大的全尺寸適應性繼續領跑
谷歌釋出適用於 Mac 的 Gemini Spark 智慧助手
Gemini Spark,Google 用於管理您數字生活的 AI 助手,現已在 Mac 上可用。週三,Google 宣佈將 Spark 整合到現有的 Gemini 桌面應用程式中,並附帶多項更新和新功能,包括實時主題更新以及與更多應用程式(如 Google Tasks 和 Google Keep)的連線。macOS 版本的釋出使 Gemini Spark 能夠更好地與 Claude Desktop、Microsoft 的 Copilot 以及 OpenClaw 等桌面 AI 代理競爭,因為它現
相關專題推薦
評論 (1)
0/500

近期,AMD 正式推出了一款名為vLLM-ATOM 的新外掛程式。其核心目標是在不改變現有工作流程的前提下,充分釋放硬體潛力,為 DeepSeek-R1、Kimi-K2 及 gpt-oss-120B 等主流大型語言模型帶來顯著的推論速度提升。
對開發者而言,vLLM是一個開源框架,旨在優化高並發環境下的吞吐量與 GPU 記憶體使用效率。與傳統的單請求工具不同,它著重於請求調度與快取管理。 AMD 的新款 ATOM 外掛程式是一項專為Instinct GPU 打造的深度客製化解決方案。其突出特點在於「無縫遷移」:企業用戶無需修改現有的 API 介面、指令或端到端工作流程;該外掛程式會自動在後台處理底層的效能優化。
從技術架構角度來看,vLLM-ATOM 採用精確的三層設計。最上層保留了 vLLM 的請求調度與相容性介面;中間層(即 ATOM 外掛程式)負責管理模型實作與核心優化; 底層的AITER 則直接連接到 GPU 硬體,提供諸如 Flash Attention、量化 GEMM 以及融合 MoE 等核心加速功能。
此外掛程式主要針對Instinct MI350、MI400 及 MI355X 等高效能 GPU 運算卡。 其支援清單涵蓋 Qwen3、GLM 和 DeepSeek 等旗艦模型,並全面支援各種架構,包括 MoE(專家混合模型)、密集模型以及視覺語言模型(VLM)。
業界分析師指出,此解決方案的核心價值在於大幅降低高效能運算的部署門檻。透過這種無需學習曲線、平滑遷移的方法,企業能更輕鬆地將 AI 服務遷移至 AMD 硬體後端,在維持推論效率的同時,有效提升大型模型線上服務的穩定性與響應速度。
亞馬遜運用人工智慧與潔淨能源推動資料中心擴建
亞馬遜運用人工智慧、核能及電動車,在擴展基礎設施的同時降低碳強度。圖片來源:亞馬遜亞馬遜的《2025年永續發展報告》詳述了這家科技巨頭如何整合人工智慧與核能投資,在擴展全球基礎設施的同時降低碳排放。根據亞馬遜《2025年永續發展報告》,該公司全球營運所消耗的電力已連續第三年100%由再生能源供應。該公司透過其零碳能源組合實現此目標,該組合包含 712 個專案,總容量達 42GW,以支援資料中心的全
阿里雲百鍊推出免費多模型切換功能,整合Qwen3.5與GLM-5
技術服務商正在積極拆解大模型時代的“全家桶”捆綁策略。2026年2月25日,36氪報道,阿里雲旗下大模型服務平臺“百鍊”正式推出全新程式設計計劃。該舉措透過API服務將中國四大頂級開源模型整合於一套方案中。這一戰略舉措將阿里雲定位為全球首家提供“多模型無縫且免費切換”的雲服務提供商,有效消除了開發者此前在不同模型API之間切換時面臨的摩擦。核心亮點:四大“神獸”齊聚百鍊該程式設計計劃首批引入了當前最具競爭力的四款開源模型:Qwen3.5(通義千問):阿里雲自研模型,憑藉強大的全尺寸適應性繼續領跑
谷歌釋出適用於 Mac 的 Gemini Spark 智慧助手
Gemini Spark,Google 用於管理您數字生活的 AI 助手,現已在 Mac 上可用。週三,Google 宣佈將 Spark 整合到現有的 Gemini 桌面應用程式中,並附帶多項更新和新功能,包括實時主題更新以及與更多應用程式(如 Google Tasks 和 Google Keep)的連線。macOS 版本的釋出使 Gemini Spark 能夠更好地與 Claude Desktop、Microsoft 的 Copilot 以及 OpenClaw 等桌面 AI 代理競爭,因為它現





首頁






