来源笔记
Visual Sculpting: Visually-Aligned Planning Representations for Long-Horizon Robot Clay Sculpting
摘要
Visual Sculpting 是一种机器人黏土雕塑方法,它在密集深度图和空间深度梯度上进行规划,这样机器人就能同时瞄准 3D 形状和可见的表面细节。它从机器人生成的推压动作中学习深度变化动力学模型,并使用 MPC 执行长动作序列。
Problem
- 以前的可变形物体方法常常为每个目标重新训练策略,或者在大约 300 个点的稀疏点云上进行规划,这会漏掉影响雕塑外观的表面纹理和阴影线索。
- 黏土浮雕雕塑需要大量受控动作、材料在大表面上的移动,以及细微的局部细节;早期面团工作里使用的夹爪捏取会让长时域雕塑变得混乱。
- 这个问题很重要,因为只匹配粗略 3D 形状的机器人,仍然可能错过人们用来判断雕塑的视觉特征。
Approach
- 状态表示为一张 512×512 的密集深度图。视觉规划信号是这张深度图的空间梯度,它捕捉与光照和纹理相关的局部表面变化。
- 每个机器人动作都是一次线性推压,参数包括 x、y、方向 θ、行程长度 l 和深度 z。主系统使用单个末端执行器,并把它与夹爪捏取基线进行比较。
- 神经动力学模型 param2deform 根据当前深度图、其梯度以及推压形状参数 l 和 z,预测某个动作造成的深度变化。
- 模型先在固定姿态下预测形变,然后可微的透视变换把预测结果平移和旋转到所需的 x、y 和 θ。这减少了所需的机器人数据量。
- 规划使用 MPC:先贪心初始化动作,再做梯度下降或 CEM 优化,执行一小批动作,重新扫描,然后结合 3D 损失和视觉损失重新规划。
Results
- 在保留的形变预测上,加入视觉损失后,泡沫材料指标有所改善:L3D 从 0.138 降到 0.130,Lviz 从 0.025 降到 0.024,Chamfer Distance 从 0.26 降到 0.22,EMD 从 0.16 降到 0.15。这里列出的所有指标都是越低越好。
- 在面团上,加入视觉损失后,L3D 从 0.190 降到 0.187,Lviz 从 0.029 降到 0.028,Chamfer Distance 从 0.45 降到 0.41,EMD 从 0.31 降到 0.30。
- 在沙子上,视觉损失只改善了 Lviz,从 0.012 降到 0.011;L3D 从 0.043 升到 0.047,Chamfer Distance 和 EMD 分别保持在 0.40 和 0.22。
- 单末端执行器推压比夹爪捏取更容易建模,测试对象是泡沫:推压结果在 L3D+Lviz 下为 L3D 0.130、Lviz 0.024、CD 0.22、EMD 0.15;夹爪捏取结果为 L3D 0.624、Lviz 0.043、CD 0.50、EMD 0.30。
- 这个动力学模型用大约 100 次机器人动作学到了有用的状态转移,随着样本增加,性能也更好。
- 该系统生成了超过 100 个动作的长时域雕塑,包括一个从 A 到 F 的字母序列,过程中没有重置黏土,还有一个 50 动作的 X 雕塑,在执行过程中 3D 和视觉损失都在下降。摘录没有给出这些规划运行的最终数值损失。