5.83倍加速,PolicyTrim:让VLA机器人少走弯路、更快完成任务

风晨吖_2847

风晨吖_2847

2026-07-22

860人浏览

原创

【导读】vla模型已具备任务执行能力,但真实机器人仍显迟缓!policytrim是一种专为提升vla机器人运行效率而设计的优化方法,无需重新训练。它通过延长高置信动作序列、剔除无效物理动作,引导机器人以更简洁路径完成任务,显著缩短整体执行时间。

Vision-Language-Action(VLA)模型将视觉输入、语言指令与机器人动作整合于统一策略框架中,使机器人可依据自然语言指令执行复杂具身操作。

从OpenVLA、OpenVLA-OFT,到π0.5、GR00T,该类模型正逐步成为具身智能发展的核心技术路径。

然而,当VLA模型实际部署至物理机器人平台时,一个关键制约因素迅速浮现:任务总耗时不仅取决于单次推理速度,更取决于策略需触发多少次推理、执行多少个真实物理动作。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

5.83倍加速,PolicyTrim:让VLA机器人少走弯路、更快完成任务

同一任务在多次运行中,VLA策略所需步数差异明显——表明更短、更优的成功路径本就存在,但当前策略往往仅能偶然抵达。

动作chunk尾部稳定性不足:模型一次预测多个连续动作,但越靠后的动作越易受误差累积影响;系统被迫频繁中断并重规划,强行拉长动作窗口反而降低成功率、增加物理步数。

物理动作高度冗余:即便最终成功,轨迹中仍常包含大量修正、回退与重复操作。

因此,VLA的实际部署效能,不能仅看单步推理延迟,更要关注“策略效率”(policy efficiency):一次预测中,有多少动作可被安全执行?完成任务究竟需要多少真实物理动作?

现有优化手段多聚焦于计算层面,如视觉token剪枝、模型量化、KV-cache复用、知识蒸馏或推理引擎调优。这些方法虽能压缩单次推理耗时,但若策略本身仍依赖大量冗余物理动作,则端到端任务耗时难以实质性改善。

盲目延长action chunk执行长度亦不可取。

论文实验表明:强制扩大动作预测窗口后,成功率可能下降,物理步数反而上升。这说明低质量尾部预测会将误差引入真实环境,迫使机器人投入更多纠错动作。

核心问题在于:能否在不损害任务成功率的前提下,通过后训练方式,让已有VLA策略自主习得“直击目标”的行为模式,以更少物理步骤达成任务?

四川大学雷印杰教授团队提出PolicyTrim——一种面向“策略效率”提升的两阶段强化学习后训练框架。该方法不改动VLA原始架构,也不依赖新采集专家数据,仅在预训练策略基础上进行轻量级行为优化。

5.83倍加速,PolicyTrim:让VLA机器人少走弯路、更快完成任务

项目主页:https://www.php.cn/link/1a534df4ec7023f89613a24be21a149f

论文链接:https://www.php.cn/link/a7a0a1f4201d3a346c365914c1ebb3bd

代码链接:https://www.php.cn/link/f5728573b5d4984431695a41396314be

模型链接:https://www.php.cn/link/7b5fb650c7bca123d83dd9cf7f7f9bca

新方法达成以下成果:

  • 动作chunk有效利用率提升3倍,支持更长时域下的稳定执行;
  • 物理步数减少51.4%,大幅削减纠错与重复动作;
  • 在LIBERO Object/π0.5任务上实现最高5.83倍端到端加速;

从「算得更快」迈向「做得更快」

PolicyTrim并非旨在替代计算侧优化,而是补足长期被忽视的关键维度:降低完成任务所需的前向推理次数。它将策略效率解耦为两个可独立优化的目标——先拓展可靠动作窗口,再精简物理执行步数。

5.83倍加速,PolicyTrim:让VLA机器人少走弯路、更快完成任务

1. 可靠动作chunk拓展(Reliable Action Chunk Extension)

当前多数VLA策略以chunk形式输出动作序列,但实际部署中常仅采纳前几帧。PolicyTrim第一阶段采用动态执行窗口探索机制:在同一批rollout中分配不同接受比例,驱动模型在短、中、长多种窗口下协同探索其可靠性边界。

知海图Chat
知海图Chat

知海图Chat是基于知乎与面壁智能合作大模型能力的中文知识问答工具。

下载

成功完成任务且使用更长窗口的轨迹获得更高奖励,激励模型提升原本不稳定chunk尾部动作的可用性。

horizon reward仅在组内出现至少一条成功轨迹时激活,防止模型在失败场景下盲目追求窗口延长。

2. 冗余感知型步数压缩(Redundancy-Aware Step Reduction)

在可靠执行窗口扩展完成后,第二阶段进一步压缩总物理步数。PolicyTrim引入step-saving reward机制:成功轨迹所用步数越少,奖励越高。

该reward直接将“更短、更优的成功路径”嵌入优化目标。

group-anchored regularization机制则抑制不可泛化的捷径行为,避免模型为追求步数缩减而牺牲任务成功率。

两阶段顺序优化有效规避“延长chunk”与“压缩步数”之间的目标冲突,最终显著减少完成任务所需的前向推理次数。

实验结果

研究团队在LIBERO、ManiSkill、Meta-World及真实机器人平台上全面验证PolicyTrim效果,并覆盖π0.5、OpenVLA-OFT、GR00T等多种主流VLA架构。总体结果显示:PolicyTrim在维持任务成功率不变的前提下,大幅提升执行效率。

在LIBERO基准中,π0.5模型实现最高5.83倍端到端加速,同时成功率稳定在98%以上。

跨基准测试显示,PolicyTrim在ManiSkill上最高达2.36倍加速,在Meta-World上达2.52倍加速。

跨架构测试表明,经完整两阶段优化的OpenVLA-OFT可获得2.97倍加速;仅启用第二阶段的OpenVLA亦可达1.41倍加速。

5.83倍加速,PolicyTrim:让VLA机器人少走弯路、更快完成任务

定性对比:路径更优,动作更凝练

在随机抽取的LIBERO任务中,Baseline策略常出现反复修正、目标附近犹豫抖动等现象;而PolicyTrim生成的轨迹更流畅、更直接,通常仅需原步数约一半即可完成相同任务。

5.83倍加速,PolicyTrim:让VLA机器人少走弯路、更快完成任务

真实机器人部署:仿真增益可无缝迁移至物理世界

研究进一步在搭载双Intel RealSense D435i相机的Agilex Piper机械臂上开展真实任务验证,涵盖FlipMug、HangMug、TapeBox三类典型操作。实验包括固定目标位置的标准设定,以及抓取过程中随机扰动目标的动态设定。

PolicyTrim在标准与动态扰动两种设置下均保持或提升成功率,同时显著缩短真实执行耗时。在标准真实机器人设置中,平均实现1.86倍端到端加速。

5.83倍加速,PolicyTrim:让VLA机器人少走弯路、更快完成任务

5.83倍加速,PolicyTrim:让VLA机器人少走弯路、更快完成任务

实验结果证实,PolicyTrim并非仅提升benchmark分数:在物理机器人上,任务完成时间亦可压缩至baseline约一半水平,且在动态干扰场景中展现出良好鲁棒性。

PolicyTrim为何有效?

• 直击策略行为瓶颈:减少冗余动作与非必要重规划,而非仅压缩单次推理延迟;
• 免重训轻部署:作为后训练框架,可在已有VLA模型基础上快速迭代,大幅降低数据与训练成本;
• 速度与成功率兼顾:通过可靠horizon扩展规避盲目扩窗风险,借助稳定性约束防止短路径投机;
• 与计算侧优化正交兼容:PolicyTrim优化推理次数,VLA-Cache等方法优化单次耗时,二者叠加可产生协同加速效应。

PolicyTrim的核心主张是:对VLA机器人而言,部署效率不仅源于模型推理更快,更源于策略行为更高效。让机器人“少绕弯路”,同样能带来可观性能跃升。

参考资料:https://www.php.cn/link/a7a0a1f4201d3a346c365914c1ebb3bd

本文来自微信公众号“新智元”,作者:新智元;编辑:LRST,36氪经授权发布。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
FrankenPHP集成Laravel详细教程
FrankenPHP集成Laravel详细教程

本专题提供FrankenPHP集成Laravel的详细配置指南,全面解析运行原理、开发环境搭建、Caddyfile配置、Octane工作模式、数据库连接、队列任务、定时任务和生产环境优化,解决部署过程中常见的报错与兼容性问题。

2026.10.08

40

20

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

2026.09.30

140

10

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

2026.09.30

140

14

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

2026.09.30

100

12

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

2026.09.30

100

26

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

2026.09.29

120

15

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

320

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

220

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

180

15

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习