趋势

244 条趋势 · 第 12 / 21 页
周 · 2026-W19 · Software Intelligence

编码代理面临更严格的信任测试:执行轨迹、仓库纪律和行动前检查

本周研究把大语言模型(LLM)编码代理视为需要先给出证据才能被信任的系统。最有力的工作通过执行、仓库任务、形式化证明、工具契约和对抗性安全测试来检查生成代码。SWE Atlas、VeriContest 和 RubricRefine 展示了同一个实用标准:有用的代理必须留下可检查的证据,处理常规工程工作,并避免不安全操作。

周 · 2026-W19 · Embodied AI

机器人 VLA 可靠性取决于可恢复控制和紧凑前瞻

本周机器人语料把 Vision-Language-Action (VLA) 策略视为可部署的控制系统。最有力的工作衡量漂移后的恢复、长任务中的记忆,以及低成本世界状态预测。RePO-VLA、ECHO 和 OneWM-VLA 支撑了这一信号。前几周已经强调在线执行;本周加入了更具体的测试,覆盖恢复数据、紧凑内部状态和已发布模型检查。