微软开源了Phi-4-Vision,一款轻量级多模态AI模型
微软已正式将其最新的多模态推理模型 Phi-4-reasoning-vision-15B 开源。该模型拥有 150 亿个参数,在高性能与低成本之间实现了理想的平衡。其轻量级架构使其成为在资源受限环境中处理复杂视觉任务的极具吸引力的新选择。
由精炼数据驱动的“紧凑型强力引擎”
与通常基于数万亿令牌训练的行业模型不同,Phi-4-reasoning-vision仅使用2000亿个多模态令牌进行开发。团队通过对开源数据进行严格清洗、生成针对性的合成数据,并精心校准领域特定数据的比例(例如增加数学内容以增强计算推理能力),从而优先保证了数据质量。这种方法使其在科学推理和屏幕元素定位任务中表现出色。

创新的混合推理策略
该模型的关键创新在于其“混合推理路径”设计:
感知任务:对于图像描述或OCR等简单任务,模型默认采用直接答题模式,以速度和低延迟为优化目标。
推理任务:当面对复杂逻辑(如解读数学公式或科学图表)时,模型会自动启动结构化的思维链(CoT)过程,以确保答案的准确性。
用户还可通过特定触发短语手动在两种模式间切换,从而根据不同应用需求调整模型的行为。
通过集成 SigLIP-2 动态分辨率编码器,该模型在识别高分辨率截图中的细微细节方面表现卓越。这一能力使其成为开发计算机使用代理(CUA)的理想基础,这类代理能够准确识别并交互数字界面上的按钮、输入框及其他元素。
Phi-4-reasoning-vision-15B 现已登陆各大开源平台。微软展望,这一紧凑型模型将证明在多模态领域,“更小、更快”同样意味着“更强大”,从而推动空间智能和实时交互技术的普及。
相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
评论 (1)
0/500
微软已正式将其最新的多模态推理模型 Phi-4-reasoning-vision-15B 开源。该模型拥有 150 亿个参数,在高性能与低成本之间实现了理想的平衡。其轻量级架构使其成为在资源受限环境中处理复杂视觉任务的极具吸引力的新选择。
由精炼数据驱动的“紧凑型强力引擎”
与通常基于数万亿令牌训练的行业模型不同,Phi-4-reasoning-vision仅使用2000亿个多模态令牌进行开发。团队通过对开源数据进行严格清洗、生成针对性的合成数据,并精心校准领域特定数据的比例(例如增加数学内容以增强计算推理能力),从而优先保证了数据质量。这种方法使其在科学推理和屏幕元素定位任务中表现出色。

创新的混合推理策略
该模型的关键创新在于其“混合推理路径”设计:
感知任务:对于图像描述或OCR等简单任务,模型默认采用直接答题模式,以速度和低延迟为优化目标。
推理任务:当面对复杂逻辑(如解读数学公式或科学图表)时,模型会自动启动结构化的思维链(CoT)过程,以确保答案的准确性。
用户还可通过特定触发短语手动在两种模式间切换,从而根据不同应用需求调整模型的行为。
通过集成 SigLIP-2 动态分辨率编码器,该模型在识别高分辨率截图中的细微细节方面表现卓越。这一能力使其成为开发计算机使用代理(CUA)的理想基础,这类代理能够准确识别并交互数字界面上的按钮、输入框及其他元素。
Phi-4-reasoning-vision-15B 现已登陆各大开源平台。微软展望,这一紧凑型模型将证明在多模态领域,“更小、更快”同样意味着“更强大”,从而推动空间智能和实时交互技术的普及。
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic





首页






