首页 > 教程攻略 > ai资讯 >5.83倍加速,PolicyTrim:让VLA机器人少走弯路、更快完成任务

5.83倍加速,PolicyTrim:让VLA机器人少走弯路、更快完成任务

来源:互联网 时间:2026-07-22 15:36:24

来自四川大学雷印杰教授团队的研究人员提出了一种名为PolicyTrim的方法,旨在优化VLA(视觉-语言-动作)模型在机器人上的执行效率。该方法无需重新训练模型,通过扩展可靠动作序列并减少冗余步骤,帮助机器人用更少的物理动作完成任务,从而提升整体速度。

PolicyTrim是一个面向“策略效率”的两阶段强化学习后训练框架,不改变VLA架构,也不重新收集专家数据,而是在已有预训练策略之上继续优化机器人的真实执行行为。该方法已在LIBERO、ManiSkill、Meta-World以及真实机器人任务上完成验证,覆盖了π0.5、OpenVLA-OFT、GR00T等不同VLA架构。

核心方法:两阶段优化策略效率

PolicyTrim的核心目标是通过减少完成任务所需的前向推理次数,提升策略效率。它首先扩展可靠动作chunk,随后压缩冗余物理步骤。

第一阶段为“可靠动作chunk扩展”(Reliable Action Chunk Extension)。当前VLA策略通常以动作chunk形式输出动作序列,但部署时往往只敢执行前几步。PolicyTrim在第一阶段采用动态执行窗口探索(dynamic execution horizon exploration),在同一组rollout中分配不同的接受比率,让模型在短、中、长窗口上并行探索可靠边界。成功完成任务且执行窗口更长的轨迹获得更高奖励,以此鼓励模型将原本不可靠的chunk尾部动作变得更可用。horizon奖励仅在组内出现成功轨迹时激活,避免模型在失败情况下盲目追求更长的chunk长度。

第二阶段为“冗余感知的步数压缩”(Redundancy-Aware Step Reduction)。在可靠horizon被扩展后,该阶段进一步减少总物理步数。PolicyTrim引入step-sa ving奖励:成功轨迹用越少步骤完成任务,奖励越高。同时,group-anchored regularization用于抑制不可复现的投机捷径,避免模型只追求短路径却损害成功率。两阶段顺序优化旨在避免“拉长chunk”和“缩短步数”两个目标互相干扰。

实验结果:效率提升与成功率保持

论文在多个基准和真实机器人上验证了PolicyTrim的效果。总体结果显示,该方法在保持任务成功率稳定的同时,显著提升了执行效率。

在LIBERO基准中,基于π0.5模型达到最高5.83倍端到端加速,同时成功率保持在98%以上。在ManiSkill上达到最高2.36倍加速,在Meta-World上达到2.52倍加速。跨架构实验显示,重新预训练后的OpenVLA-OFT采用完整两阶段流程可达到2.97倍加速;OpenVLA仅使用第二阶段也能达到1.41倍加速。

定性对比显示,在随机采样的LIBERO任务中,Baseline往往出现冗余纠错动作和目标附近的犹豫/抖动,而PolicyTrim的轨迹更平滑、更直接,通常能将物理步数压缩至原来的一半左右。

真实机器人部署验证

论文进一步在配有两台Intel RealSense D435i相机的Agilex Piper机械臂上验证了真实机器人任务,包括FlipMug、HangMug、Ta peBox三类任务。实验覆盖固定目标位置的标准设置,以及抓取过程中随机扰动目标的动态设置。

在标准设置和动态扰动设置下,PolicyTrim都维持或提升了成功率,同时显著缩短了真实执行时间。在标准真实机器人设置下,平均达到1.86倍端到端加速。在物理机器人上,任务完成时间缩短到baseline的一半左右,并且在动态干扰场景中保持鲁棒性。

项目主页:https://inceptionwang.github.io/PolicyTrim/

论文链接:https://arxiv.org/abs/2606.22540

代码链接:https://github.com/INCEPTIONwang/PolicyTrim

模型链接:https://huggingface.co/INCEPTIONwang/PolicyTrim