面向消费类 PC 和笔记本电脑推出 Qwen 2.5-Omni-3B 人工智能机型

中国电子商务和云计算领导者阿里巴巴继续以其最新创新成果向全球人工智能开发者发起挑战。在推出先进的开源 Qwen3 大型推理模型系列后不久,Qwen 团队又发布了 Qwen2.5-Omni-3B - 一个针对消费级硬件进行了优化的精简版多模态模型,同时在文本、音频、图像和视频处理方面保持了强劲的性能。
Qwen2.5-Omni-3B 是 70 亿参数旗舰模型的 30 亿参数浓缩迭代。参数决定了模型的操作复杂性,参数数越多,功能越强。尽管规模缩小了,但这一紧凑型版本仍保留了其前代产品 90% 以上的多模态性能,同时提供实时文本和自然语音生成功能。
关键的改进在于 GPU 内存优化。据开发团队报告,在处理 25,000 个 token 的扩展输入时,VRAM 消耗量减少了 50%。通过技术改进,内存需求从 60.2 GB(7B 机型)降至 28.2 GB(3B 机型),从而可以在高级消费设备而非企业级硬件的 24GB GPU 上运行。
这种效率源于创新的架构元素,包括 Thinker-Talker 框架和定制的 TMRoPE 定位编码,该编码可同步进行视频和音频处理。目前的授权仅限于研究应用,企业需要从阿里巴巴的启文团队获得更多权限才能进行商业实施。
该版本满足了市场对可部署多模态解决方案日益增长的需求,其性能指标可与大型模型相媲美。您可以通过以下方式访问该版本:
- 抱抱脸
- GitHub
- 模型范围
集成选项包括 Hugging Face Transformers、Docker 容器和阿里巴巴的 vLLM 平台,以及 FlashAttention 2 和 BF16 精度等可选增强功能,以加速性能并减少内存开销。
基准性能比较
任务 Qwen2.5-Omni-3B Qwen2.5-Omni-7B
OmniBench(多模式推理) 52.2 56.1
视频本(音频理解) 68.8 74.1
MMMU(图像推理) 53.1 59.2
MVBench(视频推理) 68.7 70.3
Seed-tts-eval test-hard(语音生成) 92.1 93.5
视听任务中的性能差异极小,这凸显了 3B 模型的设计效率,对于需要高质量输出的实时应用来说尤其宝贵。
实时多模态功能
Qwen2.5-Omni-3B 可同时处理多模态输入,并即时生成文本和音频响应。该型号结合了语音个性化功能,有两种预设选项--Chelsie(女性)和 Ethan(男性)--可适应不同的使用情况。用户可选择音频或纯文本输出,还可选择禁用音频以进一步节省内存。
社区发展
Qwen 团队通过全面的工具包、预培训检查点、API 可访问性和部署文档,倡导开源协作。Qwen2.5-Omni系列在Hugging Face的趋势模型排名中名列前茅,获得了极大的关注。团队成员林俊阳在 X 上写道:"许多用户要求部署一个紧凑的 Omni 模型,而我们正是这样做的。
企业影响
对于负责人工智能开发和基础设施的技术领导者来说,Qwen2.5-Omni-3B 既是机遇,也是限制。Qwen2.5-Omni-3B 能够在消费级硬件上实现与大型机型相匹配的性能,这表明它具有实际的部署潜力,但许可证方面的限制也需要慎重考虑。
根据阿里云的 Qwen Research 许可协议,该模型仅限于非商业应用。企业可以为内部研究对其进行评估、基准测试和改进,但在未获得商业许可的情况下,不得在面向客户或创收的系统中实施。
因此,Qwen2.5-Omni-3B 主要被定位为原型开发和评估工具,而非生产解决方案。IT 团队可以利用它在研究参数范围内进行管道开发、工具改进和架构评估。数据工程师和安全专业人员可以探索其功能,进行内部验证,但敏感数据的生产部署需要符合许可要求。
最终,该模型在保持商业限制的同时,降低了多模式人工智能实验的技术门槛。它可作为企业权衡构建与购买决策的战略评估资源,但生产部署需要正式参与阿里巴巴的许可框架。
相关文章
小鹏汽车旗下的Dogotix完成9亿美元融资
小鹏汽车旗下的Dogotix部门正在研发IRON人形机器人。来源:小鹏汽车效仿其他全球主要汽车制造商的做法,小鹏汽车正将业务拓展至类人机器人领域。 这家电动汽车制造商今日宣布,其机器人子公司Dogotix在首轮融资中筹集了超过9亿美元,此轮融资前的估值为50亿美元,交易后的估值超过63亿美元。据小鹏汽车称,这笔资金将用于推进软硬件开发、收集运营数据、训练物理AI模型、建立量产设施,并推动全球业务扩
三位人工智能先驱在安全担忧日益加剧之际,主张保持大型模型的开放性
诸如“前沿节奏”(Pacing the Frontier)之类的倡议旨在通过与主要实验室合作来确保人工智能安全,然而开源模型在行业内仍是一个充满争议的话题。由于其免费分发且缺乏使用控制,开源权重模型难以监管,导致一些机构对此感到高度担忧。然而,在上周于拉斯维加斯举行的 Ai4 会议上,三位著名的人工智能专家——诺贝尔奖得主杰弗里·辛顿(Geoffrey Hinton)、World Labs 首席执行官兼联合创始人李飞飞(Fei-Fei Li)以及 Coursera 联合创始人吴恩达(Andre
Base44 推出专有 AI 模型,以增强其 Vibe Coding 平台的安全性
Base44,这个一年前仅成立六个月、团队规模仅为八人的初创公司,被Wix以8000万美元收购,如今已开始部署其专有AI模型,帮助用户使用自然语言构建应用程序。这一进展正值AI社区争论前沿模型是否适用于所有用例,以及依赖外部模型的企业能否保持长期竞争优势之时。总部位于湾区的Base44的最新战略旨在解决这两方面的担忧。尽管其定制大语言模型(LLM)刚刚推出,Base44的目标是最终超越前沿模型。创始人Maor Shlomo指出,“作为我们整个技术栈的一部分来训练并拥有该模型,使我们能够在延迟
相关专题推荐
评论 (2)
0/500
Finally, a model that can run on my laptop without setting my room on fire... 🔥 but seriously, 3B params for local AI? That's cool but will it outrun my fan noise? 😂

中国电子商务和云计算领导者阿里巴巴继续以其最新创新成果向全球人工智能开发者发起挑战。在推出先进的开源 Qwen3 大型推理模型系列后不久,Qwen 团队又发布了 Qwen2.5-Omni-3B - 一个针对消费级硬件进行了优化的精简版多模态模型,同时在文本、音频、图像和视频处理方面保持了强劲的性能。
Qwen2.5-Omni-3B 是 70 亿参数旗舰模型的 30 亿参数浓缩迭代。参数决定了模型的操作复杂性,参数数越多,功能越强。尽管规模缩小了,但这一紧凑型版本仍保留了其前代产品 90% 以上的多模态性能,同时提供实时文本和自然语音生成功能。
关键的改进在于 GPU 内存优化。据开发团队报告,在处理 25,000 个 token 的扩展输入时,VRAM 消耗量减少了 50%。通过技术改进,内存需求从 60.2 GB(7B 机型)降至 28.2 GB(3B 机型),从而可以在高级消费设备而非企业级硬件的 24GB GPU 上运行。
这种效率源于创新的架构元素,包括 Thinker-Talker 框架和定制的 TMRoPE 定位编码,该编码可同步进行视频和音频处理。目前的授权仅限于研究应用,企业需要从阿里巴巴的启文团队获得更多权限才能进行商业实施。
该版本满足了市场对可部署多模态解决方案日益增长的需求,其性能指标可与大型模型相媲美。您可以通过以下方式访问该版本:
- 抱抱脸
- GitHub
- 模型范围
集成选项包括 Hugging Face Transformers、Docker 容器和阿里巴巴的 vLLM 平台,以及 FlashAttention 2 和 BF16 精度等可选增强功能,以加速性能并减少内存开销。
基准性能比较
| 任务 | Qwen2.5-Omni-3B | Qwen2.5-Omni-7B |
|---|---|---|
| OmniBench(多模式推理) | 52.2 | 56.1 |
| 视频本(音频理解) | 68.8 | 74.1 |
| MMMU(图像推理) | 53.1 | 59.2 |
| MVBench(视频推理) | 68.7 | 70.3 |
| Seed-tts-eval test-hard(语音生成) | 92.1 | 93.5 |
视听任务中的性能差异极小,这凸显了 3B 模型的设计效率,对于需要高质量输出的实时应用来说尤其宝贵。
实时多模态功能
Qwen2.5-Omni-3B 可同时处理多模态输入,并即时生成文本和音频响应。该型号结合了语音个性化功能,有两种预设选项--Chelsie(女性)和 Ethan(男性)--可适应不同的使用情况。用户可选择音频或纯文本输出,还可选择禁用音频以进一步节省内存。
社区发展
Qwen 团队通过全面的工具包、预培训检查点、API 可访问性和部署文档,倡导开源协作。Qwen2.5-Omni系列在Hugging Face的趋势模型排名中名列前茅,获得了极大的关注。团队成员林俊阳在 X 上写道:"许多用户要求部署一个紧凑的 Omni 模型,而我们正是这样做的。
企业影响
对于负责人工智能开发和基础设施的技术领导者来说,Qwen2.5-Omni-3B 既是机遇,也是限制。Qwen2.5-Omni-3B 能够在消费级硬件上实现与大型机型相匹配的性能,这表明它具有实际的部署潜力,但许可证方面的限制也需要慎重考虑。
根据阿里云的 Qwen Research 许可协议,该模型仅限于非商业应用。企业可以为内部研究对其进行评估、基准测试和改进,但在未获得商业许可的情况下,不得在面向客户或创收的系统中实施。
因此,Qwen2.5-Omni-3B 主要被定位为原型开发和评估工具,而非生产解决方案。IT 团队可以利用它在研究参数范围内进行管道开发、工具改进和架构评估。数据工程师和安全专业人员可以探索其功能,进行内部验证,但敏感数据的生产部署需要符合许可要求。
最终,该模型在保持商业限制的同时,降低了多模式人工智能实验的技术门槛。它可作为企业权衡构建与购买决策的战略评估资源,但生产部署需要正式参与阿里巴巴的许可框架。
小鹏汽车旗下的Dogotix完成9亿美元融资
小鹏汽车旗下的Dogotix部门正在研发IRON人形机器人。来源:小鹏汽车效仿其他全球主要汽车制造商的做法,小鹏汽车正将业务拓展至类人机器人领域。 这家电动汽车制造商今日宣布,其机器人子公司Dogotix在首轮融资中筹集了超过9亿美元,此轮融资前的估值为50亿美元,交易后的估值超过63亿美元。据小鹏汽车称,这笔资金将用于推进软硬件开发、收集运营数据、训练物理AI模型、建立量产设施,并推动全球业务扩
三位人工智能先驱在安全担忧日益加剧之际,主张保持大型模型的开放性
诸如“前沿节奏”(Pacing the Frontier)之类的倡议旨在通过与主要实验室合作来确保人工智能安全,然而开源模型在行业内仍是一个充满争议的话题。由于其免费分发且缺乏使用控制,开源权重模型难以监管,导致一些机构对此感到高度担忧。然而,在上周于拉斯维加斯举行的 Ai4 会议上,三位著名的人工智能专家——诺贝尔奖得主杰弗里·辛顿(Geoffrey Hinton)、World Labs 首席执行官兼联合创始人李飞飞(Fei-Fei Li)以及 Coursera 联合创始人吴恩达(Andre
Base44 推出专有 AI 模型,以增强其 Vibe Coding 平台的安全性
Base44,这个一年前仅成立六个月、团队规模仅为八人的初创公司,被Wix以8000万美元收购,如今已开始部署其专有AI模型,帮助用户使用自然语言构建应用程序。这一进展正值AI社区争论前沿模型是否适用于所有用例,以及依赖外部模型的企业能否保持长期竞争优势之时。总部位于湾区的Base44的最新战略旨在解决这两方面的担忧。尽管其定制大语言模型(LLM)刚刚推出,Base44的目标是最终超越前沿模型。创始人Maor Shlomo指出,“作为我们整个技术栈的一部分来训练并拥有该模型,使我们能够在延迟
Finally, a model that can run on my laptop without setting my room on fire... 🔥 but seriously, 3B params for local AI? That's cool but will it outrun my fan noise? 😂





首页






