来源笔记

Toward Safe Autonomous Robotic Endovascular Interventions using World Models

World ModelsEndovascular RoboticsSafe Robot LearningSim2realModel Based RL

本文研究用于机械取栓的自主机器人导航,检验一种基于世界模型的强化学习智能体能否在未见过的解剖结构中完成更长、更难的血管导航任务。核心结论是,TD-MPC2 在模拟环境中比 SAC 具有更好的泛化能力和导航质量,同时导丝受力远低于文中给出的血管破裂阈值,并且在体外实验中的成功率相近。

  • 任务是机械取栓中的自主血管内导航,机器人需要在实时条件下操控导管和导丝穿过患者特异性的血管。
  • 现有强化学习方法在长时序控制、解剖差异和超出训练血管的迁移上表现有限。
  • 安全性很重要,因为过大的导丝尖端受力会损伤血管;文中给出的建议血管破裂阈值是 1.5 N。
  • 作者训练了一个基于 TD-MPC2 的多任务世界模型智能体,并将其与用于五个与取栓相关导航任务的先进 SAC 基线进行比较。
  • 智能体只接收跟踪到的二维器械尖端状态、前一状态、目标位置和前一动作,这与透视引导式导航一致,而不是使用完整的血管几何。
  • 训练在模拟中使用 10 个患者特异性血管解剖结构,评估在 5 个留出的解剖结构上进行,并在患者特异性的 3D 打印血管模型上开展透视引导的体外测试。
  • TD-MPC2 学习导管和导丝运动的潜在动力学模型,然后在该学习到的模型内规划短动作序列,而不是只靠逐步试错反应。
  • 研究还在模拟中测量导丝尖端的平均和最大接触力,并在训练中通过随机缩放、旋转和随机插入点做 sim-to-real 增强。
  • 留出模拟测试: TD-MPC2 在各任务上的平均成功率为 58%,SAC 为 36%p < 0.001);平均路径比为 49%,SAC 为 22%p < 0.001);但耗时更长,分别为 17.1 s9.6 sp < 0.001)。
  • 模拟安全性: TD-MPC2 的平均尖端受力为 0.15 N最大尖端受力为 0.55 N;SAC 分别为 0.13 N0.50 N。这些受力都远低于文中的 1.5 N 破裂阈值。
  • 单任务模拟提升: TD-MPC2 在困难任务上提升了成功率,例如 A2L:38% 对 8%A2R:52% 对 8%A3L:38% 对 16%;对应的路径比提升为 40% 对 21%48% 对 24%63% 对 21%
  • 体外模型测试: TD-MPC2 的平均成功率为 68%,SAC 为 60%差异不显著p = 0.567);但 TD-MPC2 的平均路径比更高,为 54% 对 44%p < 0.05),而且手术时间更长:111.0 s 对 66.2 sp < 0.001)。
  • 体外单任务细节:A2L 上,两种方法都为 0% 成功率,但 TD-MPC2 的路径比提高到 71% 对 47%p = 0.017)。在 A2R 上,TD-MPC2 的成功率为 60%,SAC 为 40%;在 A3R 上为 80% 对 60%,但在报告的小样本条件下这些差异不显著。
  • 训练效率: 图中结果对应的探索步数,TD-MPC2 为 0.5e6,训练 25 小时;SAC 为 4.5e6,训练 75 小时。这说明在报告的设置下,世界模型方案学得更快。