可执行证据主导智能体软件可靠性研究
当天最强的信号是面向智能体软件的可执行证据。论文用生成输入测试代码,用遥测诊断失败运行,并围绕技能或工具动作施加约束。现在,智能体输出要先有可检查的轨迹,团队才会信任它。
当天最强的信号是面向智能体软件的可执行证据。论文用生成输入测试代码,用遥测诊断失败运行,并围绕技能或工具动作施加约束。现在,智能体输出要先有可检查的轨迹,团队才会信任它。
当天的机器人工作把 Vision-Language-Action(VLA)模型当作可部署的控制系统。ECHO 扩展了长时程记忆,KeyStone 改进了推理时的随机动作选择,ATAAT 则表明视觉后门可以在微调后保留下来。共同的检验标准是:机器人策略在更长任务、新数据、不确定样本和已发布模型风险下,能否保住有用行为。
编码代理研究正在用可执行检查来测试决策质量。FixedBench 测量代理什么时候应该保持代码不变。SWE Atlas 评测日常仓库工作。VeriContest 表明,普通代码生成离机器检查过的正确性还有差距。
这段时间窗口里的机器人论文把 Vision-Language-Action(VLA)策略当作可部署的控制系统来处理。紧凑的世界状态、接触反馈、失败数据和低预算适配都接受了具体测试。OneWM-VLA、AT-VLA 和 ForgeVLA 给出了最清楚的量化信号。
当天最清晰的信号是,对大型语言模型(LLM)软件代理的评估在收紧。生成代码必须满足架构、测试、迁移和真实开发者轨迹的要求。TACT 和 ASTOR 改善了控制。仓库证据仍然显示,很多代理过不了结构和维护要求。
这一时期的机器人研究集中在能否在场景变化下继续工作的控制。视觉-语言-动作(VLA)论文把物体身份、手部接触、动作条件世界模型和模拟器保真度都变成了可测量对象。OA-WAM、HumanNet 和 VISER 提供了最清楚的证据,因为它们把机制和基准或验证结果放在一起。
当天最强的软件代理论文都让大语言模型 (LLMs) 先提出代码、计划或动作,再用执行、验证器、检索门控或实时工具检查它们。ReaComp、Slyp 和 ARC-AGI-3 展示了同一个当前重点:代理输出需要可测试的底座和受限的操作范围。
当前的重点是让机器人策略在部署约束下保留有用的内部状态。Vision-Language-Action(VLA)工作关注紧凑的空间 token、潜在动作监督和测试时视觉校正。Dream-MPC 把同样的压力带到连续控制中:在线规划,但把模型调用次数压低。
5 月 5 日的软件 AI 论文把大语言模型(LLM)放到可执行检查下。MOSAIC-Bench 暴露了分阶段编码代理的漏洞。TDD-Bench-Java 和 PoVSmith 检验生成的产物是否会失败、通过、编译,或者触发真实 bug。
当天最清楚的信号是具身 AI 受到评测压力。经过几天的 Vision-Language-Action(VLA)部署工作后,这些论文把成功条件放到了记忆、接触感知、动作条件预测和空间一致性上。RLDX-1、RoboAlign-R1 和 iWorld-Bench 提供了最强的证据。
5 月 4 日最强的工作把大语言模型(LLM)编码代理当作工程系统来审视,关注受限工具、显式仓库状态和可测量成本。Terminus-4B、ARISE 和 TSCG 给出了最清楚的证据:当代理拿到合适的接口时,更小的专用组件可以节省 token,或者改善修复效果。
这一时期最强的信号是对 Vision-Language-Action(VLA)机器人策略的实际部署压力。MolmoAct2 用开放权重和机器人数据集来说明可复现性。Latent Bridge 和异步推理基准关注的是,策略能否在不损失任务成功率的情况下保持较高控制频率。