机器人 VLA 论文正在转向基于 rollout 的可靠性
机器人视觉-语言-动作(VLA)研究正聚焦于真实操作证据:开放 rollout、部署检查和安全指标。ABC 让行为克隆更容易复现。E-TTS 加入推理时候选打分。ForesightSafety-VLA 在完整轨迹中评估不安全成功。
机器人视觉-语言-动作(VLA)研究正聚焦于真实操作证据:开放 rollout、部署检查和安全指标。ABC 让行为克隆更容易复现。E-TTS 加入推理时候选打分。ForesightSafety-VLA 在完整轨迹中评估不安全成功。
机器人团队现在可以在总体任务成功率之外,用更多检查来做部署决策。具体改动包括:用 commissioning rollout 在冻结专家中做选择,为 VLA 执行加上候选打分和物理可行性检查,并在 rollout 评审中加入不安全成功指标。
这个时期的重点是编码代理通过压缩证据、尽早剪掉薄弱轨迹、并在更难环境里自测来提升。最强的论文是 Scaling Test-Time Compute for Agentic Coding、LinuxArena 和 Argus。放在一起看,它们给出一个直接判断:进展来自更严格地控制代理保留什么、复用什么、以及允许它做什么,并且已经在 SWE 任务、运维基准和底层 kernel 工作上看到具体收益。
这段时间的编码代理工作支持三个具体变化:在仓库任务的重跑前加轨迹压缩,为小模型代理加中途预算控制,以及在包含滥用任务和监控限制的实时环境中评估面向生产的代理。论文给出的运作机制和可测增益越具体,这些结论就越强,尤其是在通过率、成本或监控规避率上。