針對消費性 PC 和筆記型電腦推出 Qwen 2.5-Omni-3B AI 機型

中國電子商務和雲領導者阿里巴巴繼續以其最新的創新成果挑戰全球的人工智能開發者。在推出先進的開源 Qwen3 大型推理模型系列後不久,Qwen 團隊又推出了 Qwen2.5-Omni-3B--一個針對消費級硬體進行優化的精簡型多模態模型,同時在文字、音訊、圖像和視頻處理方面保持強大的性能。
Qwen2.5-Omni-3B 是旗艦級 70 億參數模型的 30 億參數迭代。參數定義了模型的操作複雜性,而更高的參數通常能夠實現更大的功能。儘管規模縮小了,這個精簡版本仍保留了前代版本 90% 以上的多模態效能,同時提供即時文字和自然語音生成功能。
關鍵的改進在於 GPU 記憶體最佳化。據開發團隊報告,在處理 25,000 個字元的擴展輸入時,VRAM 消耗量減少了 50%。透過技術改進,記憶體需求從 60.2 GB (7B 機型) 降至 28.2 GB (3B 機型),可在高級消費性裝置的 24GB GPU 而非企業級硬體上運作。
這樣的效率來自創新的架構元素,包括 Thinker-Talker 框架和客製化 TMRoPE 定位編碼,可同步處理視訊和音訊。目前的授權僅限於研究應用,企業需要從阿里巴巴的 Qwen Team 獲得額外許可才能進行商業實施。
該版本滿足了市場對可部署的多模態解決方案日益增長的需求,其性能指標可媲美大型機型。可透過以下方式存取:
- 抱抱臉
- GitHub
- 模型範圍
整合選項包括 Hugging Face Transformers、Docker containers 和阿里巴巴的 vLLM 平台,並可選用 FlashAttention 2 和 BF16 精度等增強功能,以加速效能並降低記憶體開銷。
基準效能比較
任務 Qwen2.5-Omni-3B Qwen2.5-Omni-7B
OmniBench (多模式推理) 52.2 56.1
VideoBench (音訊理解) 68.8 74.1
MMMU (影像推理) 53.1 59.2
MVBench (視訊推理) 68.7 70.3
Seed-tts-eval test-hard(語音生成) 92.1 93.5
視聽任務的效能差異極小,強調了 3B 模型的設計效率,對於需要高品質輸出的即時應用程式而言尤其寶貴。
即時多模式功能
Qwen2.5-Omni-3B 可處理同步的多模態輸入,同時產生即時的文字和音訊回應。該機型整合了語音個人化功能,提供兩種預設選項-Chelsie (女性) 和 Ethan (男性),可適用於不同的使用情況。使用者可選擇語音或純文字輸出,並可選擇關閉語音以進一步節省記憶體。
社群發展
Qwen 團隊透過全面的工具包、預先訓練的檢查點、API 可訪問性和部署文件,提倡開放源碼合作。Qwen2.5-Omni 系列已獲得顯著的吸引力,在 Hugging Face 的趨勢模型排名中名列前茅。團隊成員林俊陽在 X 上指出:「雖然許多用戶要求部署精簡的 Omni 模型,但我們正是提供了這樣的產品。
企業影響
對於監督 AI 開發與基礎架構的技術領導者而言,Qwen2.5-Omni-3B 同時帶來了機會與限制。Qwen2.5-Omni-3B 在消費性硬體上的效能可媲美大型機型,這顯示了實際的部署潛力,但授權限制也需要謹慎考量。
根據阿里巴巴雲的 Qwen 研究授權協議,該模型僅限於非商業應用。機構可以為內部研究進行評估、基準測試和改良,但如果沒有獲得商業許可,則不能在面向客戶或創收的系統中實施。
因此,Qwen2.5-Omni-3B 主要定位為原型與評估工具,而非生產解決方案。IT 團隊可以利用它在研究參數範圍內進行管道開發、工具改進和架構評估。資料工程師和安全專業人員可探索其功能,以進行內部驗證,但使用敏感資料進行生產部署需要符合授權規定。
最終,該模型降低了多模式 AI 實驗的技術障礙,同時維持了商業限制。它可作為企業權衡建立與購買決策的策略評估資源,但生產部署需要正式參與阿里巴巴的授權框架。
相關文章
小鵬汽車旗下的 Dogotix 成功募得 9 億美元資金
小鵬汽車旗下的 Dogotix 部門正在研發「IRON」人形機器人。來源:小鵬汽車效法其他全球主要汽車製造商的做法,小鵬汽車正將業務拓展至人形機器人領域。 這家電動車製造商今日宣布,其機器人子公司 Dogotix 已在首輪融資中籌得逾 9 億美元,融資前估值達 50 億美元,交易後估值更超過 63 億美元。據小鵬汽車表示,這筆資金將用於推進硬體與軟體開發、蒐集營運數據、訓練物理人工智慧模型、建立量
三位人工智慧先驅在安全擔憂日益加劇之際,主張保持大型模型的開放性
諸如“前沿節奏”(Pacing the Frontier)之類的倡議旨在透過與主要實驗室合作來確保人工智慧安全,然而開源模型在行業內仍是一個充滿爭議的話題。由於其免費分發且缺乏使用控制,開源權重模型難以監管,導致一些機構對此感到高度擔憂。然而,在上週於拉斯維加斯舉行的 Ai4 會議上,三位著名的人工智慧專家——諾貝爾獎得主傑弗裡·辛頓(Geoffrey Hinton)、World Labs 執行長兼聯合創始人李飛飛(Fei-Fei Li)以及 Coursera 聯合創始人吳恩達(Andre
Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性
Base44,這個一年前僅成立六個月、團隊規模僅為八人的初創公司,被Wix以8000萬美元收購,如今已開始部署其專有AI模型,幫助使用者使用自然語言構建應用程式。這一進展正值AI社羣爭論前沿模型是否適用於所有用例,以及依賴外部模型的企業能否保持長期競爭優勢之時。總部位於灣區的Base44的最新戰略旨在解決這兩方面的擔憂。儘管其定製大語言模型(LLM)剛剛推出,Base44的目標是最終超越前沿模型。創始人Maor Shlomo指出,“作為我們整個技術棧的一部分來訓練並擁有該模型,使我們能夠在延遲
相關專題推薦
評論 (2)
0/500
Finally, a model that can run on my laptop without setting my room on fire... 🔥 but seriously, 3B params for local AI? That's cool but will it outrun my fan noise? 😂

中國電子商務和雲領導者阿里巴巴繼續以其最新的創新成果挑戰全球的人工智能開發者。在推出先進的開源 Qwen3 大型推理模型系列後不久,Qwen 團隊又推出了 Qwen2.5-Omni-3B--一個針對消費級硬體進行優化的精簡型多模態模型,同時在文字、音訊、圖像和視頻處理方面保持強大的性能。
Qwen2.5-Omni-3B 是旗艦級 70 億參數模型的 30 億參數迭代。參數定義了模型的操作複雜性,而更高的參數通常能夠實現更大的功能。儘管規模縮小了,這個精簡版本仍保留了前代版本 90% 以上的多模態效能,同時提供即時文字和自然語音生成功能。
關鍵的改進在於 GPU 記憶體最佳化。據開發團隊報告,在處理 25,000 個字元的擴展輸入時,VRAM 消耗量減少了 50%。透過技術改進,記憶體需求從 60.2 GB (7B 機型) 降至 28.2 GB (3B 機型),可在高級消費性裝置的 24GB GPU 而非企業級硬體上運作。
這樣的效率來自創新的架構元素,包括 Thinker-Talker 框架和客製化 TMRoPE 定位編碼,可同步處理視訊和音訊。目前的授權僅限於研究應用,企業需要從阿里巴巴的 Qwen Team 獲得額外許可才能進行商業實施。
該版本滿足了市場對可部署的多模態解決方案日益增長的需求,其性能指標可媲美大型機型。可透過以下方式存取:
- 抱抱臉
- GitHub
- 模型範圍
整合選項包括 Hugging Face Transformers、Docker containers 和阿里巴巴的 vLLM 平台,並可選用 FlashAttention 2 和 BF16 精度等增強功能,以加速效能並降低記憶體開銷。
基準效能比較
| 任務 | Qwen2.5-Omni-3B | Qwen2.5-Omni-7B |
|---|---|---|
| OmniBench (多模式推理) | 52.2 | 56.1 |
| VideoBench (音訊理解) | 68.8 | 74.1 |
| MMMU (影像推理) | 53.1 | 59.2 |
| MVBench (視訊推理) | 68.7 | 70.3 |
| Seed-tts-eval test-hard(語音生成) | 92.1 | 93.5 |
視聽任務的效能差異極小,強調了 3B 模型的設計效率,對於需要高品質輸出的即時應用程式而言尤其寶貴。
即時多模式功能
Qwen2.5-Omni-3B 可處理同步的多模態輸入,同時產生即時的文字和音訊回應。該機型整合了語音個人化功能,提供兩種預設選項-Chelsie (女性) 和 Ethan (男性),可適用於不同的使用情況。使用者可選擇語音或純文字輸出,並可選擇關閉語音以進一步節省記憶體。
社群發展
Qwen 團隊透過全面的工具包、預先訓練的檢查點、API 可訪問性和部署文件,提倡開放源碼合作。Qwen2.5-Omni 系列已獲得顯著的吸引力,在 Hugging Face 的趨勢模型排名中名列前茅。團隊成員林俊陽在 X 上指出:「雖然許多用戶要求部署精簡的 Omni 模型,但我們正是提供了這樣的產品。
企業影響
對於監督 AI 開發與基礎架構的技術領導者而言,Qwen2.5-Omni-3B 同時帶來了機會與限制。Qwen2.5-Omni-3B 在消費性硬體上的效能可媲美大型機型,這顯示了實際的部署潛力,但授權限制也需要謹慎考量。
根據阿里巴巴雲的 Qwen 研究授權協議,該模型僅限於非商業應用。機構可以為內部研究進行評估、基準測試和改良,但如果沒有獲得商業許可,則不能在面向客戶或創收的系統中實施。
因此,Qwen2.5-Omni-3B 主要定位為原型與評估工具,而非生產解決方案。IT 團隊可以利用它在研究參數範圍內進行管道開發、工具改進和架構評估。資料工程師和安全專業人員可探索其功能,以進行內部驗證,但使用敏感資料進行生產部署需要符合授權規定。
最終,該模型降低了多模式 AI 實驗的技術障礙,同時維持了商業限制。它可作為企業權衡建立與購買決策的策略評估資源,但生產部署需要正式參與阿里巴巴的授權框架。
小鵬汽車旗下的 Dogotix 成功募得 9 億美元資金
小鵬汽車旗下的 Dogotix 部門正在研發「IRON」人形機器人。來源:小鵬汽車效法其他全球主要汽車製造商的做法,小鵬汽車正將業務拓展至人形機器人領域。 這家電動車製造商今日宣布,其機器人子公司 Dogotix 已在首輪融資中籌得逾 9 億美元,融資前估值達 50 億美元,交易後估值更超過 63 億美元。據小鵬汽車表示,這筆資金將用於推進硬體與軟體開發、蒐集營運數據、訓練物理人工智慧模型、建立量
三位人工智慧先驅在安全擔憂日益加劇之際,主張保持大型模型的開放性
諸如“前沿節奏”(Pacing the Frontier)之類的倡議旨在透過與主要實驗室合作來確保人工智慧安全,然而開源模型在行業內仍是一個充滿爭議的話題。由於其免費分發且缺乏使用控制,開源權重模型難以監管,導致一些機構對此感到高度擔憂。然而,在上週於拉斯維加斯舉行的 Ai4 會議上,三位著名的人工智慧專家——諾貝爾獎得主傑弗裡·辛頓(Geoffrey Hinton)、World Labs 執行長兼聯合創始人李飛飛(Fei-Fei Li)以及 Coursera 聯合創始人吳恩達(Andre
Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性
Base44,這個一年前僅成立六個月、團隊規模僅為八人的初創公司,被Wix以8000萬美元收購,如今已開始部署其專有AI模型,幫助使用者使用自然語言構建應用程式。這一進展正值AI社羣爭論前沿模型是否適用於所有用例,以及依賴外部模型的企業能否保持長期競爭優勢之時。總部位於灣區的Base44的最新戰略旨在解決這兩方面的擔憂。儘管其定製大語言模型(LLM)剛剛推出,Base44的目標是最終超越前沿模型。創始人Maor Shlomo指出,“作為我們整個技術棧的一部分來訓練並擁有該模型,使我們能夠在延遲
Finally, a model that can run on my laptop without setting my room on fire... 🔥 but seriously, 3B params for local AI? That's cool but will it outrun my fan noise? 😂





首頁






