首页 > 教程攻略 > ai教程 >ECCV 2026 连中三篇!群核科技联合NVIDIA、Adobe推出仿真器SPEAR

ECCV 2026 连中三篇!群核科技联合NVIDIA、Adobe推出仿真器SPEAR

来源:互联网 时间:2026-07-03 07:30:06

先说一个正在发生的趋势:Physical AI 的竞争,正在从算法层悄悄转向基础设施层。为什么这么说?因为物理AI的学习方式,跟大语言模型有着本质区别。

大语言模型可以从互联网上获取海量文本——那是人类几千年文明的数字化沉淀。可机器人面对的是一个几乎不存在现成数据池的物理世界。有报告显示,全球高质量的真实物理交互数据总量,大约只有50万小时;而要实现具身AI模型能力的突破,需要的训练数据量级,是以千万小时起步的。仿真训练,正从过去的“研发辅助工具”,升级为Physical AI时代最核心的基础设施。

群核科技在这个节点上,于ECCV 2026连续入选了三篇论文。仔细一看,这三篇工作恰好覆盖了具身智能、空间智能、世界模型领域最关键的三个问题:从真实感仿真器的性能瓶颈突破,到全球尺度的交互式空间智能评测,再到强化学习中的数据自进化。把这些工作串起来,正好勾勒出“仿真-数据-评测”这样一条完整的Physical AI基础设施雏形。

这不是简单的学术成绩,更是一份来自产业界的清晰信号:Physical AI的竞争,已经从论文和模型,走向了真正的“基建”之争。接下来,我们逐一拆解这三篇论文,看看群核科技究竟在哪三个关键问题上给出了自己的答案。

SPEAR——真实感具身智能仿真器

论文背景

机器人到底去哪训练?这个问题困扰了学术界和工业界很久。现实世界里,让机器人真机训练,成本高、风险大、迭代慢。仿真训练是必经之路,但现有的仿真器总让人感觉“隔靴搔痒”——要么画质不够真实,要么接口不够灵活,要么渲染速度拖后腿。群核科技联合Adobe等机构,推出了SPEAR:一个基于虚幻引擎的真实感具身智能仿真器。

SPEAR代码地址:

https://github.com/spear-sim/spear

\

图. SPEAR是一个Python库,能够通过模块化插件架构连接并以编程方式控制任何虚幻引擎应用程序

技术介绍

SPEAR的核心是一个Python库,通过模块化插件架构,可以连接并编程控制任何虚幻引擎应用程序。它向Python开放了14,485个独特的UE函数——这个数量比现有基于UE的仿真器高出一个数量级——并且实现了每秒超过1亿像素的真实感渲染速度,同样比现有的UE插件快一个数量级。

\

表. 各种UE仿真器可编程功能的比较

\

图. SPEAR编程模型

值得一提的还有SPEAR的异步编程模型。它为每个函数都提供了异步变体,避免了与UE的同步阻塞,同时还能在UE函数与Python代码之间,无需数据拷贝就直接传递NumPy数组。这意味着SPEAR可以做到以原生帧率执行用户的Python代码。

\

图. 展示了如何利用编程模型中的异步操作来彻底避免阻塞UE游戏线程,从而使UE应用程序能够以原生帧率执行用户的Python代码

在编程模型层面,SPEAR的UE工作图被指定为事务。用户通过定义begin_frame end_frame 上下文来指定一个事务,在这个上下文里,只需要编写Python代码就能实现UE任务图。此外,SPEAR还集成了进程间共享内存机制,渲染后的图像可以直接从GPU传输到用户的NumPy数组中,没有额外的数据复制。

实验结果

SPEAR的实验结果,可以说是“降维打击”级别的。

在可编程功能数量上,SPEAR支持超过14,000个UE函数和变量,而现有的UE仿真器(CARLA、AirSim、UnrealCV等)只提供几百个。可SPEAR的代码量却精简得惊人——Python和C++代码行数都远低于基线系统。在渲染性能上,SPEAR将真实感图像转为仿真可用的NumPy数组,速度达到了56帧/秒,比现有UE插件快了一个数量级——比UnrealCV快15倍,比AirSim快12倍,与CARLA端到端性能相当,同时支持更高质量的真实感渲染。

在应用示范方面,SPEAR展现了惊人的灵活性:它可以控制城市尺度环境中6种不同动作空间的具身智能体(人、汽车、飞行机器人、四足机器人等),操纵UE的程序化内容生成系统,渲染高精度人脸的多视角图像,还能与MuJoCo物理引擎进行交互式协同仿真。

可以说,SPEAR的性能非常强大,有望成为计算机视觉、机器人学和具身智能领域的基础性数据引擎。

除了硬核技术,这篇论文的作者阵容也相当强大。除了群核科技的参与,还有来自产业界长期深耕仿真、3D视觉方向的专家,包括Adobe高级研究科学家Mike Roberts,英伟达仿真生态系统开发总监German Ros,苏黎世联邦理工学院副教授Stefan Leutenegger(代表工作:BRISK、ElasticFusion),Adobe研究院首席科学家Kalyan Sunka valli(代表工作:LRM、Point-NeRF),以及Apple的杰出科学家Vladlen Koltun(谷歌学术引用量突破10万,2017年11月推出自动驾驶测试基准CARLA,已成为该领域广泛使用的基准测试平台)。这也解释了为什么SPEAR会如此注重解决仿真中的实用性问题。

WalkerBench——基于真实街景的交互式空间智能评测基准

论文背景

如何评测空间智能?这个问题在Physical AI领域变得越来越紧迫。当前主流的视觉语言模型在二维图像理解上持续突破,可在三维空间推理上的表现却始终难以量化——行业缺少一把能“测准”的尺子。

现有空间智能评测基准有一个通病:它们让AI当“观众”,采用“旁观者视角”——给一张静态图片或一段视频,让模型去“猜”空间关系。但真正的空间智能,需要具身智能体能够与物理世界进行主动交互——通过移动来消除几何歧义,通过多视角观察来建立空间认知。这一测,VLM的真实短板就暴露出来了。

WalkerBench代码地址:

https://github.com/lalayang123456-ctrl/WalkerBench

\

图. 静态感知与交互式空间智能

技术介绍

针对这个问题,群核科技联合浙江大学推出了WalkerBench:这是首个建立在真实街景和地图数据之上的全球尺度交互式空间智能评测基准,覆盖了全球160多座城市,包含两大类层次化空间任务。

\

图. WalkerBench概览

WalkerBench的两大任务:

一是主动感知:智能体必须通过主动移动来解析几何歧义,完成距离估计、建筑高度估计、相对方位估计等度量任务。二是空间导航:智能体需要在8种城市拓扑结构(Grid、Block、Star、Curved等)中完成长程导航,细分为Geometric Na vigation(剥离街名的纯结构导航)和Visual Semantic Na vigation(基于地标描述的多模态导航)。

数据构建方面,WalkerBench采用了一套全自动数据引擎——通过各向同性的BFS扩展、虚拟链接补全、贪婪最远点采样等机制,从2,408个原始候选中蒸馏出1,000个高质量精心设计的任务。最关键的是,WalkerBench剥离了街名,大量采样非英语城市(如达卡、罗安达、卡拉奇)来抑制世界知识记忆,确保评测的是实时的视觉推理能力,而不是记忆的地理知识。

针对VLM线性上下文与3D拓扑任务之间的根本性不匹配,WalkerBench配套提出了Spatial-IDE框架。它通过两种机制运作:一是状态外化:将隐式观测转化为显式拓扑记忆——一个动态图结构,记录节点的坐标、朝向、遍历历史和语义注释,并以固定token预算序列化,从根本上避免了“走着走着就忘了”的问题。二是认知解耦:将视觉理解拆解为目标导向感知——只回答推理引擎提出的具体问题,比如“药店招牌是否可见,方位多少?”——和空间推理引擎,让VLM专注于纯高层决策,不再被冗长的历史上下文压垮。

\

图. Spatial-IDE框架

实验结果

WalkerBench的评测结果,可以用三个“震撼”来概括。

第一组震撼:人类vs模型。人类得分69.43%,而最好的VLM Agents(Claude-Opus-4.6)仅达到24.49%。这一巨大差距表明,当前VLM在交互式空间智能任务上远未饱和。

第二组震撼:Spatial-IDE让模型性能全面显著提升。Spatial-IDE让所有9个被测的VLM Agents模型取得了一致且巨大的提升——平均提升104.97%。Claude-Opus-4.6从24.49%跃升至43.17%(提升76.28%),GLM-4.6V从13.31%跃升至31.77%(提升138.69%)。值得注意的是,GPT-5-chat-latest原始排名垫底,但在Spatial-IDE帮助下,性能提升119.98%,说明其缺陷主要在于上下文管理失效,而非感知能力本身。

第三组震撼:零样本迁移到真实机器人。Spatial-IDE被直接部署到宇树G1人形机器人上,在真实城市环境中完成了千米级多街区自主导航——仅靠自然语言指令和机载RGB摄像头,无需任何环境特定微调。这证明WalkerBench中学到的空间推理能力可以直接迁移到物理世界。

\

表. 本文详细分析了使用和不使用Spatial-IDE的视觉语言智能体在各个子任务和整体上的性能,以及相对于原始设置的总分提升。子任务得分和总分均以准确率(%)表示。人类(参考)作为上限基线

消融实验进一步表明,ETM和GDP两大组件具有显著的协同效应:单独加ETM提升9.66点,单独加GDP提升11.97点,而两者结合提升高达18.49点——这说明“记住什么”和“看什么”这两个子问题被解耦后,VLM才能真正发挥推理潜力。

\

表. 针对Spatial-IDE两个核心组件的消融实验。所有数值均为九个智能体的平均值。子任务得分及总分均以准确率(%)表示。∆表示相对于原始基线的绝对提升

Syn-GRPO——自进化数据合成与强化学习框架

论文背景

DeepSeek-R1的横空出世,让GRPO成为后训练阶段的核心算法之一。然而,GRPO训练中有一个棘手的问题:多模态大语言模型的熵和多样性呈现急剧下降趋势,即所谓的“熵崩溃”和“多样性崩溃”。本质上,这是因为现有视觉感知数据集的样本格式过于单一,无法激发MLLM的多样化响应,从而严重限制了强化学习的探索空间。现有方法如CLIP-Higher、Clip-Cov等,都试图从GRPO算法本身入手来缓解这一问题,但始终无法从根本上突破低质量数据的天花板。

Syn-GRPO代码地址:

https://github.com/hqhQAQ/Syn-GRPO

\

图. 在GRPO训练中,MLLM生成的答案缺乏多样性且熵值较低,从而限制了强化学习(RL)的探索空间

技术介绍

群核科技联合浙江大学提出的Syn-GRPO,给出了一个全新的解决思路:为什么不直接在训练过程中动态合成更高质量的数据呢?

Syn-GRPO由两大组件构成:

1)数据服务器

这是业界首个针对图像模态突破数据局限的在线合成系统。数据服务器基于原始图像和新图像描述,通过outpainting模型生成全新图像。其两大核心特征是:前景一致性——先用前景分割模型去除无关背景,再用outpainting模型生成新背景,使视觉感知任务的标签在新图像中保持完全正确,同时通过保留前景来缓解新老数据分布差异过大的问题。解耦设计——数据服务器与GRPO工作流完全解耦,通过统一API通信,使数据生成和GRPO训练可以异步执行,几乎不增加额外训练时间。

2)GRPO工作流

GRPO工作流在原始GRPO基础上引入了三个关键改进:新图像描述——MLLM在输出推理过程和最终答案之外,还需预测一个用于生成新图像的文本描述。多样性奖励——MLLM同时预测“预测多样性”,通过比较预测多样性与实际rollout多样性(准确率奖励的方差)来计算奖励,从而监督MLLM学会为那些能激发多样响应的样本生成更好的图像描述。为应对训练过程中多样性整体漂移的问题,还引入了多样性平滑策略——使用指数移动平均来校准每个batch的多样性。描述选择——从G个响应中选择多样性奖励最高的图像描述发送给数据服务器。

最终的奖励函数为:准确率奖励 + 格式奖励 + 多样性奖励。模型在最大化这一综合奖励的过程中,既能提升任务精度,又能学会“如何描述一张能让模型学到更多东西的图像”。

\

图. Syn-GRPO框架

实验结果

Syn-GRPO在REC、OVD和ISR三项视觉感知任务上均取得了显著超越现有方法的性能。

在REC任务上,Qwen2.5-VL-3B(基线模型)+ Syn-GRPO在LISA-Grounding数据集上达到68.28%,远超VLM-R1的63.14%和GRPO的62.24%;在RefCOCO数据集上达到92.15%,同样全面领先。

\

表. Qwen2.5-VL-3B在REC任务上的实验结果

在OVD任务上,Syn-GRPO的mAP达到23.74%,GP达到71.42%,GR达到46.44%,全面超越GRPO和VLM-R1。

\

表. OVD任务上的实验结果

更值得关注的是两组揭示性现象:

数据规模Scaling Law:随着训练数据从400增加到2,000样本,Syn-GRPO的性能呈现持续稳定上升趋势,预示着在更大规模RL训练中具有长期可扩展性。生成数据复杂度递增:随着训练迭代推进,生成的图像呈现出越来越复杂的趋势——这意味着Syn-GRPO是一个真正的“自进化”系统,能够自适应地生成越来越有挑战性的样本,而不是像传统方法那样越训越“死”。

此外,解耦设计使异步Syn-GRPO的训练时间仅比原始GRPO多约5%,而同步设计则会使训练时间翻倍。多样性平滑策略也显著提升了训练的稳定性和最终精度。

在REC、OVD和ISR这三大项视觉感知任务上的实验结果表明,Syn-GRPO显著提升了数据质量,且性能大幅优于现有的强化学习方法。

总结

回头看群核科技这三篇ECCV 2026论文:

SPEAR解决了“在哪训练”的问题——提供了一套高速、高真实感、高灵活性的仿真基础设施;WalkerBench解决了“怎么评测”的问题——提供了一个全球尺度、真实场景、交互式的空间智能评测基准;Syn-GRPO解决了“高质量数据从哪来”的问题——提供了一套能在训练中自我进化的数据合成框架。

从仿真平台到评测基准,再到数据进化,群核科技这次在ECCV 2026上的三篇论文,已经初步搭建起物理AI训练所需的关键能力链条,形成了一个动态进化的数据飞轮。

相比单点算法创新,更值得关注的是,这些工作共同指向了一套完整的Embodied AI基础设施。当Physical AI的竞争正从算法层加速转向基础设施层时,谁先建成这套“路、桥、港”,谁就将在机器人与具身智能的下一阶段竞争中占据先机。而这,或许才是群核科技这三篇ECCV 2026论文背后真正的战略意义所在。

图片图片