DeepSeek 发布了首款专为 AI 代理设计的开源多模态模型
DeepSeek已在Hugging Face上发布了DeepSeek-V4-Flash-Vision-Exp,这标志着V4系列中首个采用MIT许可证的实验性多模态模型正式亮相。 该模型拥有 3050 亿个参数,基于 V4-Flash-0731 基础模型构建,将其视觉编码器和 Aligner 集成到核心语言架构中,从而通过持续训练实现强大的图像理解能力。

聚焦多模态智能体,而不仅仅是图像描述
与专注于视觉问答的传统多模态模型不同,DeepSeek 重新定义了 Vision 版本的宗旨:优先考虑多模态代理的能力。 官方文档强调,智能体能够直接解读视觉输入——例如网页截图、软件界面和图表——并通过调用工具来执行任务。本质上,这只“眼睛”是为机器智能体而非人类用户设计的。
该开源包内容全面,包含模型权重、Tokenizer、提示词编码参考实现以及最简化的 PyTorch 推理配置。它涵盖了视觉编码器、Aligner、DFlash Attention、MoE 和 Hyper-Connections 等核心模块。 社区反应迅速,Hugging Face 上已提供适用于 llama.cpp、LM Studio 和 Ollama 的七个量化版本。
值得关注的时间线细节揭示了其战略性的发布流程:该模型于 8 月 21 日首次出现在 DeepSeek API 上,当时仅可通过 API 访问,且未发布权重。 开发者可同时输入文本和图像,图像处理按令牌计费。十天后,权重正式发布,支持本地部署和二次开发。这种“先API,后开源”的策略凸显了DeepSeek作为API服务提供商的核心定位。

性能接近 Claude Opus 4.8,经官方实测验证
基准测试结果表明,添加视觉能力并未显著影响纯文本代理的性能:Terminal Bench 2.1 得分从 82.7 升至 83.9,DeepSWE 得分从 54.4 提升至 59.3,超越了 Opus 4.8 的 58.0。 多模态智能代理的改进更为显著:ApexBench Pass@1 达到 36.5, Agents' Last Exam得分为27.3(超过Opus 4.8的25.7),ZeroBench Pass@5则达到35.0,优于竞争对手的34.0。
不过,DeepSeek并未宣称具有“全面优势”:在NL2Repo项目中,其得分57.7,落后于Opus 4.8的69.7。 官方声明仍持谨慎态度,仅指出“多模态智能体能力已接近 Claude Opus 4.8”。 近期更新显示,DeepSeek 正在构建一套完整的智能体技术栈:该模型负责推理和工具调用,Harness 管理持续的任务执行,而 Vision 则使智能体能够直接解读计算机视觉信息。此次开源发布是完善该生态系统的重要一步。
相关文章
美国卫生机构对OpenAI和Anthropic的人工智能模型进行评估
在全国范围内,公共卫生机构将通过由“健康人工智能联盟”(Coalition for Health AI)牵头、并与OpenAI、Anthropic及埃森哲(Accenture)合作开展的一项新计划,对生成式人工智能进行评估。“公共卫生用例与学习扩展引擎”(PULSE)将为覆盖10个州、地方、部落及领地管辖区的试点项目提供资金支持。该计划旨在为考虑部署类似人工智能技术的公共卫生机构制定可操作的实施方
支付宝“一触即付”将3000万个线下触点转变为由人工智能驱动的商业网络
继推出全栈式AI支付系统和AI驱动的支付宝助手“阿宝”之后,支付宝于7月8日宣布,其“一触即付”解决方案已完成全面AI升级。 部署在商户端的数百万台“一触即付”终端已升级为“一触即付终端代理”,与此同时,支付宝还面向中小企业推出了“一触即付代理”服务平台及“AI开放基地”。 经过两年的密集开发,“触碰支付”目前已服务4亿用户,与2300家生态服务商展开合作,运营着超过3000万个线下AI触点,构建
Tealium:为什么 RAG 质量取决于实时数据
Tealium应用人工智能部门首席产品经理弗雷迪·贝尔兰蒂(Freddy Berlanti)深入探讨了检索增强生成(RAG)技术。图片来源:Getty ImagesTealium应用人工智能首席产品经理弗雷迪·贝尔兰蒂,剖析了真正创造价值的RAG系统与那些悄然破坏用户信任的RAG系统之间的关键分水岭大多数企业级检索增强生成(RAG)系统仅能获取客户的“快照”:上周二索引的向量存储、夜间同步的知识库
相关专题推荐
评论 (0)
0/500
DeepSeek已在Hugging Face上发布了DeepSeek-V4-Flash-Vision-Exp,这标志着V4系列中首个采用MIT许可证的实验性多模态模型正式亮相。 该模型拥有 3050 亿个参数,基于 V4-Flash-0731 基础模型构建,将其视觉编码器和 Aligner 集成到核心语言架构中,从而通过持续训练实现强大的图像理解能力。

聚焦多模态智能体,而不仅仅是图像描述
与专注于视觉问答的传统多模态模型不同,DeepSeek 重新定义了 Vision 版本的宗旨:优先考虑多模态代理的能力。 官方文档强调,智能体能够直接解读视觉输入——例如网页截图、软件界面和图表——并通过调用工具来执行任务。本质上,这只“眼睛”是为机器智能体而非人类用户设计的。
该开源包内容全面,包含模型权重、Tokenizer、提示词编码参考实现以及最简化的 PyTorch 推理配置。它涵盖了视觉编码器、Aligner、DFlash Attention、MoE 和 Hyper-Connections 等核心模块。 社区反应迅速,Hugging Face 上已提供适用于 llama.cpp、LM Studio 和 Ollama 的七个量化版本。
值得关注的时间线细节揭示了其战略性的发布流程:该模型于 8 月 21 日首次出现在 DeepSeek API 上,当时仅可通过 API 访问,且未发布权重。 开发者可同时输入文本和图像,图像处理按令牌计费。十天后,权重正式发布,支持本地部署和二次开发。这种“先API,后开源”的策略凸显了DeepSeek作为API服务提供商的核心定位。

性能接近 Claude Opus 4.8,经官方实测验证
基准测试结果表明,添加视觉能力并未显著影响纯文本代理的性能:Terminal Bench 2.1 得分从 82.7 升至 83.9,DeepSWE 得分从 54.4 提升至 59.3,超越了 Opus 4.8 的 58.0。 多模态智能代理的改进更为显著:ApexBench Pass@1 达到 36.5, Agents' Last Exam得分为27.3(超过Opus 4.8的25.7),ZeroBench Pass@5则达到35.0,优于竞争对手的34.0。
不过,DeepSeek并未宣称具有“全面优势”:在NL2Repo项目中,其得分57.7,落后于Opus 4.8的69.7。 官方声明仍持谨慎态度,仅指出“多模态智能体能力已接近 Claude Opus 4.8”。 近期更新显示,DeepSeek 正在构建一套完整的智能体技术栈:该模型负责推理和工具调用,Harness 管理持续的任务执行,而 Vision 则使智能体能够直接解读计算机视觉信息。此次开源发布是完善该生态系统的重要一步。
美国卫生机构对OpenAI和Anthropic的人工智能模型进行评估
在全国范围内,公共卫生机构将通过由“健康人工智能联盟”(Coalition for Health AI)牵头、并与OpenAI、Anthropic及埃森哲(Accenture)合作开展的一项新计划,对生成式人工智能进行评估。“公共卫生用例与学习扩展引擎”(PULSE)将为覆盖10个州、地方、部落及领地管辖区的试点项目提供资金支持。该计划旨在为考虑部署类似人工智能技术的公共卫生机构制定可操作的实施方
支付宝“一触即付”将3000万个线下触点转变为由人工智能驱动的商业网络
继推出全栈式AI支付系统和AI驱动的支付宝助手“阿宝”之后,支付宝于7月8日宣布,其“一触即付”解决方案已完成全面AI升级。 部署在商户端的数百万台“一触即付”终端已升级为“一触即付终端代理”,与此同时,支付宝还面向中小企业推出了“一触即付代理”服务平台及“AI开放基地”。 经过两年的密集开发,“触碰支付”目前已服务4亿用户,与2300家生态服务商展开合作,运营着超过3000万个线下AI触点,构建
Tealium:为什么 RAG 质量取决于实时数据
Tealium应用人工智能部门首席产品经理弗雷迪·贝尔兰蒂(Freddy Berlanti)深入探讨了检索增强生成(RAG)技术。图片来源:Getty ImagesTealium应用人工智能首席产品经理弗雷迪·贝尔兰蒂,剖析了真正创造价值的RAG系统与那些悄然破坏用户信任的RAG系统之间的关键分水岭大多数企业级检索增强生成(RAG)系统仅能获取客户的“快照”:上周二索引的向量存储、夜间同步的知识库





首页






