编码代理研究正在把结构和外部检查变成主要控制面
这一天的研究表明,编码代理在控制被写下来并在模型外检查时会更好。最清楚的证据来自形式化规格、架构描述文件、harness 管理的内存和预算化评估。还有一个应用系统结果也很突出:LLM 引导的查询计划编辑在 Apache DataFusion 中带来了可测量的速度和内存收益。
这一天的研究表明,编码代理在控制被写下来并在模型外检查时会更好。最清楚的证据来自形式化规格、架构描述文件、harness 管理的内存和预算化评估。还有一个应用系统结果也很突出:LLM 引导的查询计划编辑在 Apache DataFusion 中带来了可测量的速度和内存收益。
4 月 11 日的内容不多,但很清楚。最强的工作都在要求模型在输入被污染时仍能工作,以及让视觉预测器在无需额外监督的情况下跨任务复用。STRONG-VLA 给出了机器人方向最清楚的硬指标。ZWM 则用有限的自然视频提出了更广的学习主张。
4 月 10 日是机器人主题的一天,标准很清楚:系统需要验证自己正在作用的对象,数据集需要产出真正能回放的动作。ProGAL-VLA、RoboLab 和 VAG 定下了基调。最强的论文要么直接暴露脆弱的落地对齐,要么围绕规划、合成和评测建立更紧的闭环,让失败在部署前就显现出来。
当天最强的工作都在把代码代理收紧到显式结构、受限动作和不确定条件下的判断上。Contract-Coding 给出最清楚的仓库级结果,DeepGuard 提供了更明显的安全提升,HiL-Bench 则显示请求帮助仍然是弱项。主线是可检查的控制:合约、护栏,以及能暴露判断缺口的评估。
4月9日的重点是把结构显式写进具身模型里。最清楚的模式是把形态、未来状态和物体运动学直接写入学习问题本身。WorldMAP 给出了最扎实的硬数值。HEX、QWM、ViVa、BLaDA 和 DailyArt 则把范围扩展到人形机器人、四足机器人、导航、灵巧抓取和可动对象。
这一天最清楚的模式,是对编码系统的控制更紧了。论文更多依赖测试、运行时仪表和更窄的定位方式,让输出更容易打分和检查。ZeroCoder 给出了最强的量化结果,而安全和代理论文一直在追问同一个实际问题:模型应该看到哪些证据,人又该怎样验证它实际用了什么?
这一天的内容不多,但很清楚。两篇论文都在处理更贴近现实约束的具身决策循环。一篇用事件编码情境上的记忆检索来做 UAV 控制。另一篇用有约束的想象来减少模型式强化学习里的 rollout 漂移。它们共同强调的是,在时间跨度变长或环境更复杂时,动作选择仍然要快、可检查、稳定。
当天最强的证据支持这样一种软件代理:它先写下任务,在仓库尺度上行动,并通过具体检查。ReCodeAgent 和 REAgent 在生成前加入规划或需求后,拿到了可测的提升。CLI-Tool-Bench 和 SWD-Bench 则把评测收紧到端到端行为、仓库理解和下游可用性上。
4 月 7 日是一个围绕动作循环的机器人主题日。最强的论文降低了 VLA 系统的推理成本,揭示语言有多容易把它们打断,也让动作生成更容易检查。SnapFlow、A1 和 DAERT 定下了基调:更快的控制、更严格的鲁棒性测试,以及词语和动作之间更紧的对齐。
这一天最强的工作,是让软件代理更容易被约束、检查和评分。CodeStruct 和 SWE-Shield 把代码代理评估收紧到精确编辑和设计规则。Gym-Anything 把计算机使用测试扩展到更长的真实软件任务。安全论文给出了最难反驳的证据:生成代码常常可利用,自主攻击系统在复杂的多步设置里仍会失败。
4 月 6 日最强的内容是具身控制方法,它们让机器人动作系统更容易构建、更容易调控,也更不容易失效。最清楚的证据来自 Veo-Act、StarVLA 和 E-VLA:视频预测被用于高层规划,VLA 代码库正在标准化,事件感知正在改善低光和模糊条件下的操控。当天也有评测工具和更快的机器人强化学习工作,但最扎实的主题是围绕动作的实用控制基础设施。
这一天最清楚的工作,是让软件代理更容易评分、更容易重跑,也更容易在检查失败时被拦住。Atomic-skill RL、Agent-CoEvo 和 Nidus 分别在训练目标、仓库修复和工程治理三个位置收紧控制环。和前几天相比,重点更少放在证明代理能在真实环境中行动,更多放在建立训练和验证设置,让这些动作可以被测量。