Geometry enters the control loop for robot policies
这一天的机器人工作把几何放进了执行回路。STARRY 和 X-WAM 把未来 RGB-D 预测和动作扩散联系起来,并在操作基准上报告了提升。一篇关于具身 3D 生成的综述说明了这类工作的资产要求,而户外导航研究则在真实街道上测试了语言落地的辅助能力。
这一天的机器人工作把几何放进了执行回路。STARRY 和 X-WAM 把未来 RGB-D 预测和动作扩散联系起来,并在操作基准上报告了提升。一篇关于具身 3D 生成的综述说明了这类工作的资产要求,而户外导航研究则在真实街道上测试了语言落地的辅助能力。
这一时期的基线仍然是可执行评测。最强的主张来自模型外部的部分:SWE-Edit 的读写分离、Agentic Harness Engineering 的 rollout 驱动 harness 编辑,以及 SAFEdit 的测试支撑修复循环。这个方向把上下文、工具、存储、安全提醒和推理成本都当作代理性能中可测量的部分。
当天的机器人信号是物理执行。GS-Playground 面向带接触物理的高吞吐照片级训练,HANDFUL 把手指当作多步灵巧任务中的稀缺资源。两篇论文都关注让学到的机器人策略在第一次接触之后仍然可用的条件。
当天最强的工作把代码代理当作必须遵守项目上下文、处理多文件工作流并接受可追踪证据检验的系统。Context-Augmented Code Generation 给出了最清晰的产品上下文结果。BenchGuard 和 TraceToChain 关注的是测试和可靠性声明是否可信。
当天的语料只有一篇 Google Cloud Next 回顾。它提供的是产品证据,不是研究结果。最清楚的信号是 Dart 通过 Firebase Functions 进一步进入后端工作,而 Flutter GenUI 通过现场的 agent 驱动界面展示出来。
当天最强的信号是:机器人在严格的时延和数据限制下执行任务。Vision-Language-Action(VLA)工作集中在动作拆分、高效采样、人类视频先验和边缘安全上。Libra-VLA、CF-VLA 和 AsyncShield 给出了最清楚的证据。
本周的 coding-agent 研究里,最有说服力的结论都落在可运行证据上。基准和系统持续追问的是:代码能否构建、执行,并通过工作流检查。同一批材料也反复显示出两个限制:仓库规模任务依然经常失败,而 harness 的选择对结果的影响可以和模型本身一样大。
本周有一个可以发布的研究信号,但范围较窄:Kotlin Multiplatform 被作为一种降低移动交付成本、让 iOS 和 Android 保持同步的实用途径来推广。证据来自一篇与 JetBrains 有关的案例文章,因此它适合作为采用论证,而不是严格的基准评测。与前一周覆盖范围更广的框架和工具更新相比,这一周的内容更具体,但只建立在单一来源之上。
本周的机器人研究集中在真实任务压力下的执行质量。最强的一批论文把控制状态显式化,在接触时刻加入物理反馈,并用以动作为基础的评估来判断进展。与最近几周相比,这份简报对部署条件写得更具体:恢复、干预、安全和小数据适应都被当作核心方法选择,而不是附带分析。
这一时期最强的工作收紧了生成与可执行证据之间的联系。KISS Sorcar、AgentEval 和 ClawMark 都按系统能完成什么、能追踪什么、能在真实工作流中承受什么来评分。SeGa 和 Optimas 把同样的思路扩展到基于需求的测试和基于性能分析器的优化,并在真实漏洞和测得的加速上取得了具体收益。
这一天最强的是必须在接触时刻起作用的具身控制。两篇论文都在改进操作执行:Move-Then-Operate 把接近阶段和接触阶段分开,Tube Diffusion Policy 在动作时间范围内加入逐步的视觉-触觉修正。第三篇论文用一篇关于视觉-语言-动作,也就是 VLA 系统的安全风险和防御的综述,把视角扩大到部署问题,说明部署已经成为核心研究议题的一部分。
4 月 25 日的编码研究,最强的地方在于主张能碰到可执行证据。Simulating and Evaluating Agentic Systems 和 CUJBench 都坚持用完整运行、工具轨迹、状态变化和可复现产物来评判代理。仓库工作仍然很难:RAT 改善了配置,但真实提交研究还是显示生成之后会出现编译、分析和测试失败。