编码代理需要仓库级测试和上下文防护
当天最强的信号是,围绕已经在处理多文件工作的编码代理,工程纪律开始变得更重要。DeNovoSWE、EsoLang-Bench 和 DeLM 都在测试代理能否构建完整仓库、通过执行进行适应,并且不浪费调用就共享已验证进展。安全论文给出明确警告:看起来正常的上下文,也能把生成或分析出来的代码带向不安全行为。
当天最强的信号是,围绕已经在处理多文件工作的编码代理,工程纪律开始变得更重要。DeNovoSWE、EsoLang-Bench 和 DeLM 都在测试代理能否构建完整仓库、通过执行进行适应,并且不浪费调用就共享已验证进展。安全论文给出明确警告:看起来正常的上下文,也能把生成或分析出来的代码带向不安全行为。
视觉语言动作(VLA)机器人工作的效果最好的是那些让策略保留时间状态、在出错后恢复、或接受低延迟人工输入的场景。MemoryVLA++、MotionWAM 和 YUBI 体现了当天的重点:让策略在更长时域上行动,收集更大的真实数据,并让修正尽量贴近执行。
当天的研究把 AI 软件工作当作一个工程控制问题。最强的论文会在生成代码和 agent 行动周围加入可测量的置信度、上下文限制和可追踪验证。《Code Is More Than Text》、FASE 和 Less Context, Better Agents 给出了最清晰的量化信号。
本周,机器人 Vision-Language-Action (VLA) 工作按可执行控制来评判。最有力的证据把性能收益与 3D 锚定、闭环世界模型,以及能降低真实机器人误差的动作头联系起来。Dex-BEV、PiL-World 和 ActionMap 在基准和硬件上都显示了这一模式。
本周研究把大型语言模型(LLM)代理视为受控的软件工作者。最有力的工作要求提供轨迹、可执行检查、工具限制和审查关卡。Claude Code 说明这已经不只是基准测试问题:编码代理正在进入软件供应链。
当天的信号很窄,但很明确:AI 编码代理已经进入 AI 实验室内部的软件供应链。Claude Code 是最具体的例子,Anthropic 说 Claude 在 5 月写了它发布代码的五分之四以上。
这一时期最清楚的信号是,代理在真正做事时开始被操作控制包住。Context Sculpting 测试可编辑上下文,clawdcursor 暴露带保护的桌面操作,Cursor 增加支出控制。证据很实用,但不均衡:很多条目在讲机制,少数条目给出基准。
这一天的机器人策略工作集中在可执行动作设计上。Vision-Language-Action(VLA)论文在动作头、潜在动作对齐、任务适配器和机载延迟上做调整。最强信号很实际:更高的 LIBERO 成功率、更低的 Franka 误差,以及 10 Hz 的闭环目标,和模型大小一样重要。
这一窗口里的编码代理工作围绕证据密集的控制展开:轨迹变成训练数据,仓库搜索得到行级评分,评估加入随机上限和运行时检查。Socratic-SWE、SWE-Explore 和 CapCode 的信号最强。
这一天的内容主要是机器人论文,它们把 Vision-Language-Action(VLA)策略质量当作一个闭环控制问题。WLA、MPCoT 和 PiL-World 给出了最清楚的证据:未来状态预测、潜变量动作选择和想象 rollout 都直接和成功率与延迟相关。
当天最强的信号是面向代码代理的操作性评估。论文测试反馈轮次、harness 修复、有状态记忆,以及在接近部署条件下的仓库知识。实际问题是:当轨迹、UI 测试、提交记录或重复任务里出现证据后,代理是否会变得更好。
机器人占据了当天的主要内容,策略质量被当作执行问题来检验。最强的论文在部署前加入几何、物理验证、成功评分或空间记忆。OSCAR、3DThinkVLA 和 MAD 提供了最清楚的证据。