Bounding-box-guided planner and action policy for cluttered long-horizon manipulation
做长时程桌面操作的机器人团队现在可以测试一种规划器-执行器拆分,并配上明确的定位接口:让 VLM 生成下一步子任务、目标物体和边界框,然后把全局场景 token 和该边界框的高分辨率裁剪同时送入独立的动作策略。HiVLA 在 RoboTwin 2.0 上的平均成功率为 83.3%,高于 H-RDT 的 70.6%,在更难任务和杂乱场景中的小物体操作上提升更大。这个做法的操作意义很明确:边界框引导的局部裁剪让控制器保留物体细节,同时不丢场景上下文,而规划器不再介入低层电机调参。一个成本较低的验证办法,是在一个杂乱的抓取放置或工具使用任务里加入规划器生成的裁剪图,再和单流策略比较失败模式:目标识别错误、抓取位置不准、以及多步进展丢失,这三类错误最先看。