---
source: arxiv
url: https://arxiv.org/abs/2605.17556v1
published_at: '2026-05-17T17:37:34'
authors:
- Peter Schaldenbrand
- Jean Oh
topics:
- robotic-sculpting
- deformable-manipulation
- visual-planning
- dynamics-modeling
- long-horizon-planning
- sim2real
relevance_score: 0.56
run_id: materialize-outputs
language_code: zh-CN
---

# Visual Sculpting: Visually-Aligned Planning Representations for Long-Horizon Robot Clay Sculpting

## Summary
Visual Sculpting 是一种机器人黏土雕塑方法，它在密集深度图和空间深度梯度上进行规划，这样机器人就能同时瞄准 3D 形状和可见的表面细节。它从机器人生成的推压动作中学习深度变化动力学模型，并使用 MPC 执行长动作序列。

## Problem
- 以前的可变形物体方法常常为每个目标重新训练策略，或者在大约 300 个点的稀疏点云上进行规划，这会漏掉影响雕塑外观的表面纹理和阴影线索。
- 黏土浮雕雕塑需要大量受控动作、材料在大表面上的移动，以及细微的局部细节；早期面团工作里使用的夹爪捏取会让长时域雕塑变得混乱。
- 这个问题很重要，因为只匹配粗略 3D 形状的机器人，仍然可能错过人们用来判断雕塑的视觉特征。

## Approach
- 状态表示为一张 512×512 的密集深度图。视觉规划信号是这张深度图的空间梯度，它捕捉与光照和纹理相关的局部表面变化。
- 每个机器人动作都是一次线性推压，参数包括 x、y、方向 θ、行程长度 l 和深度 z。主系统使用单个末端执行器，并把它与夹爪捏取基线进行比较。
- 神经动力学模型 param2deform 根据当前深度图、其梯度以及推压形状参数 l 和 z，预测某个动作造成的深度变化。
- 模型先在固定姿态下预测形变，然后可微的透视变换把预测结果平移和旋转到所需的 x、y 和 θ。这减少了所需的机器人数据量。
- 规划使用 MPC：先贪心初始化动作，再做梯度下降或 CEM 优化，执行一小批动作，重新扫描，然后结合 3D 损失和视觉损失重新规划。

## Results
- 在保留的形变预测上，加入视觉损失后，泡沫材料指标有所改善：L3D 从 0.138 降到 0.130，Lviz 从 0.025 降到 0.024，Chamfer Distance 从 0.26 降到 0.22，EMD 从 0.16 降到 0.15。这里列出的所有指标都是越低越好。
- 在面团上，加入视觉损失后，L3D 从 0.190 降到 0.187，Lviz 从 0.029 降到 0.028，Chamfer Distance 从 0.45 降到 0.41，EMD 从 0.31 降到 0.30。
- 在沙子上，视觉损失只改善了 Lviz，从 0.012 降到 0.011；L3D 从 0.043 升到 0.047，Chamfer Distance 和 EMD 分别保持在 0.40 和 0.22。
- 单末端执行器推压比夹爪捏取更容易建模，测试对象是泡沫：推压结果在 L3D+Lviz 下为 L3D 0.130、Lviz 0.024、CD 0.22、EMD 0.15；夹爪捏取结果为 L3D 0.624、Lviz 0.043、CD 0.50、EMD 0.30。
- 这个动力学模型用大约 100 次机器人动作学到了有用的状态转移，随着样本增加，性能也更好。
- 该系统生成了超过 100 个动作的长时域雕塑，包括一个从 A 到 F 的字母序列，过程中没有重置黏土，还有一个 50 动作的 X 雕塑，在执行过程中 3D 和视觉损失都在下降。摘录没有给出这些规划运行的最终数值损失。

## Link
- [https://arxiv.org/abs/2605.17556v1](https://arxiv.org/abs/2605.17556v1)
