谷歌DeepMind的TIPSv2:真正理解图像而非仅是匆匆一瞥的人工智能
当前,AI图像理解存在一个核心局限。
当被问及“这张图片里有什么?”时,它能给出详细的回答。然而,若问“熊猫的左后腿在哪里?”,得到的却是模棱两可的回答。这并非某个特定模型的缺陷,而是整个视觉-语言大型模型领域普遍存在的问题:具备强大的全局理解能力,却缺乏精准的局部定位能力。
谷歌DeepMind在其最新论文中推出了TIPSv2,该模型正是为解决这一难题而专门设计的。

研究团队观察到一个反直觉的现象:在精细分割任务中,较小的学生模型往往表现优于更大的教师模型。这是因为知识蒸馏去除了遮挡机制,迫使模型学习整张图像的每一个细节,从而形成一种“全域监督”。受此启发,TIPSv2引入了三项关键改进。
首先是 iBOT++。传统预训练仅针对遮罩区域计算损失,导致可见区域被忽视,从而造成局部语义漂移。iBOT++ 要求模型对所有可见区域提供精确监督,将任务从“拼图游戏”有效升级为“仔细阅读全文”。这一改进使零样本分割性能提升了 14.1 个百分点。
其次,仅头部 EMA。传统的自监督训练需要在内存中保留两个几乎完全相同的大型模型,这极度消耗资源。TIPSv2 发现,仅图像-文本对比损失就足以稳定骨干网络,因此 EMA 只需应用于最终的投影头,无需复制骨干网络。这将训练参数数量减少了约 42%,使训练速度更快,且性能几乎没有下降。
第三,多粒度文本配对。训练过程中,由 Gemini 生成的短网页描述、中等细节描述和长描述会被随机混合并输入模型,在简单任务和困难任务之间交替进行。这既防止模型在简单任务中懈怠,又确保不会遗漏任何细节。
最终结果令人信服。TIPSv2在九项任务和20个权威数据集上进行了冻结评估。零样本语义分割创下了新的行业基准,而图像文本检索和分类任务的表现则超越了参数多出56%的对比模型。纯视觉任务的表现也名列前茅。
TIPSv2的代码和模型权重已完全开源。对于从事医学影像、自动驾驶、工业检测以及其他需要高精度图像理解领域的团队而言,该解决方案值得深入研究。
论文:https://www.alphaxiv.org/abs/2604.12012
相关文章
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
加利福尼亚州自动驾驶合规:罚单、地理围栏和100万英里的新时代
Guident公司在南佛罗里达州运营一辆AuveTech自动驾驶班车,利用其远程监控技术管理西棕榈滩的一条4英里路线和博卡拉顿的一条1英里路线。| 图片来源:Guident加利福尼亚州正在重新定义无人驾驶车辆的监管格局,正逐渐摆脱科技行业“快速行动,打破常规”的思维模式,转向严格的问责制和严苛的行驶里程要求。Guident执行董事长兼首席执行官哈罗德·布劳恩(Harold Braun)在《机器人报
相关专题推荐
评论 (0)
0/500
当前,AI图像理解存在一个核心局限。
当被问及“这张图片里有什么?”时,它能给出详细的回答。然而,若问“熊猫的左后腿在哪里?”,得到的却是模棱两可的回答。这并非某个特定模型的缺陷,而是整个视觉-语言大型模型领域普遍存在的问题:具备强大的全局理解能力,却缺乏精准的局部定位能力。
谷歌DeepMind在其最新论文中推出了TIPSv2,该模型正是为解决这一难题而专门设计的。

研究团队观察到一个反直觉的现象:在精细分割任务中,较小的学生模型往往表现优于更大的教师模型。这是因为知识蒸馏去除了遮挡机制,迫使模型学习整张图像的每一个细节,从而形成一种“全域监督”。受此启发,TIPSv2引入了三项关键改进。
首先是 iBOT++。传统预训练仅针对遮罩区域计算损失,导致可见区域被忽视,从而造成局部语义漂移。iBOT++ 要求模型对所有可见区域提供精确监督,将任务从“拼图游戏”有效升级为“仔细阅读全文”。这一改进使零样本分割性能提升了 14.1 个百分点。
其次,仅头部 EMA。传统的自监督训练需要在内存中保留两个几乎完全相同的大型模型,这极度消耗资源。TIPSv2 发现,仅图像-文本对比损失就足以稳定骨干网络,因此 EMA 只需应用于最终的投影头,无需复制骨干网络。这将训练参数数量减少了约 42%,使训练速度更快,且性能几乎没有下降。
第三,多粒度文本配对。训练过程中,由 Gemini 生成的短网页描述、中等细节描述和长描述会被随机混合并输入模型,在简单任务和困难任务之间交替进行。这既防止模型在简单任务中懈怠,又确保不会遗漏任何细节。
最终结果令人信服。TIPSv2在九项任务和20个权威数据集上进行了冻结评估。零样本语义分割创下了新的行业基准,而图像文本检索和分类任务的表现则超越了参数多出56%的对比模型。纯视觉任务的表现也名列前茅。
TIPSv2的代码和模型权重已完全开源。对于从事医学影像、自动驾驶、工业检测以及其他需要高精度图像理解领域的团队而言,该解决方案值得深入研究。
论文:https://www.alphaxiv.org/abs/2604.12012
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有





首页






