首页 > 教程攻略 > ai资讯 >谷歌DeepMind新研究TIPSv2:让AI真正"看懂"图片,而不只是"扫一眼"

谷歌DeepMind新研究TIPSv2:让AI真正"看懂"图片,而不只是"扫一眼"

来源:互联网 时间:2026-07-05 14:39:08

问它“这张图里有什么”,它能答得头头是道。但要问“图中那只熊猫的左后腿在哪里”,它就开始含糊了。这可不是某个模型偶尔犯的错,而是整个视觉-语言大模型领域长期存在的通病——全局理解能力强,局部定位能力弱。

最近,谷歌DeepMind在最新论文中提出的TIPSv2方案,就是专门来啃这块硬骨头的。

image.png

研究团队在调查中发现了一个反直觉的现象:在精细分割任务上,参数量少的“学生模型”表现经常碾压体量更大的“教师模型”。原因何在?关键在于蒸馏过程移除了遮盖机制,这迫使模型必须学习整张图的所有细节,形成了一种“全区域监督”。受此启发,TIPSv2方案正是围绕这一核心发现,做出了三项关键改进。

第一项改进:iBOT++,从“猜谜”到“精读”

传统的预训练方法只对图像中被遮盖的区域计算损失,那些可见区域则处于“放养”状态,导致局部语义容易漂移。iBOT++则要求模型同时对所有可见区域进行精确监督,这相当于把训练从“猜谜游戏”升级为“全文精读”。可别小看这一项改动,仅此一项,零样本分割性能就直接提升了14.1个百分点。

第二项改进:Head-only EMA,大幅削减训练开销

传统的自监督训练需要在显存里维护两份几乎相同的大模型,开销极大。TIPSv2发现,图文对比损失本身已经能足够稳定主干网络,因此指数移动平均(EMA)只需作用于最后的投影头,主干网络不再需要复制。这一招效果显著,训练参数量直接缩减了约42%,速度更快,性能却几乎无损。

第三项改进:多粒度文本搭配,防止模型“偷懒”

在训练时,模型会被随机喂入不同粒度的文本描述:网页简短描述、中等详细描述,以及由Gemini生成的长篇描述。这种难易交替的“食谱”,既防止了模型因任务太简单而“偷懒”,又确保了图像细节不会在训练中丢失。

最终的效果相当扎实。TIPSv2在9大任务、20个权威数据集上完成了冻结评估,结果显示:其在零样本语义分割任务上刷新了业界最优成绩;在图文检索与分类任务中,击败了参数量比自身大56%的对比模型;在纯视觉任务上也全面跻身前列。

目前,TIPSv2的代码与模型权重已全面开源。对于医疗影像分析、自动驾驶感知、工业缺陷检测等需要高精度图像理解的团队来说,这套方案无疑值得认真评估。

论文地址:https://www.alphaxiv.org/abs/2604.12012