Coding agents are being judged by the evidence they leave behind
当前重点是:coding-agent 工作正在把进展绑定到可检查的证据上。P2T 组织修复步骤,SWE-Mutation 测试生成的测试能否抓住真实 bug,MOSS 在源代码更新前重放生产故障。
当前重点是:coding-agent 工作正在把进展绑定到可检查的证据上。P2T 组织修复步骤,SWE-Mutation 测试生成的测试能否抓住真实 bug,MOSS 在源代码更新前重放生产故障。
具身 AI 是中心。视觉-语言-动作(VLA)论文现在主要看 3D 接触线索、真实硬件、扰动测试和可重复评测。GaussianDream、PointACT 和 VLA-REPLICA 给出的信号最强。
当天最强的信号是可执行证明。SpecBench 表明公共测试会奖励空壳系统,而 FuzzingBrain V2 和 ERA 用评估循环来验证崩溃或改进科学指标。当前门槛是隐藏测试、运行时检查或任务特定检查下的具体行为。
具身 AI 主导了这个时期。VLA 工作按延迟、光照、扰动和细粒度任务阶段来评估,世界模型论文则在做更长的 rollout 和更便宜的合成数据。DEFLECT、MetaFine 和 WEM 给出的信号最清楚。
这一天最强的信号是运行时纪律。STORM、OpenComputer 和 DIFFCODEGEN 指向同一个要求:在团队信任更长的自主工作之前,代理需要最新状态、可执行检查,以及围绕模型输出的低成本验证。
这一时期的具身 AI 工作主要把策略当成可部署的机器人系统来处理。视觉语言动作(VLA)模型被放到灵巧手、受污染的摄像头、双臂任务和接触密集的世界模型基准上测试。Dexora、StableVLA 和 WorldArena 2.0 定下了基调:成功率、真实物理滚动、触觉信号和迁移测试,比干净的仿真分数更重要。
当前重点:编码 agent 按运行方式、修复能力和边界内行为来评判。A-ProS 展示了有状态评审反馈带来的提升。ProcBench 对轨迹中的过程缺陷打分。OverEager-Bench 衡量 benign 任务中的未授权动作。
本周最强的信号是机器人视觉-语言-动作(VLA)模型的执行质量。HarmoWAM、RAW-Dream 和 Pelican-Unified 的工作将策略增益与想象 rollouts、阶段感知动作控制和共享的推理-动作状态联系起来。
本周的代码智能体研究提高了有用工作的评测门槛。SWE-Cycle 和 SaaSBench 对设置、集成、测试和交付行为评分。Rollout Cards 为智能体运行增加报告规范。共同要求很直接:智能体需要拿出证据,证明任务是在真实运行约束下完成的。
这一时期的视觉-语言-动作(VLA)机器人工作都围绕执行展开。DyGRO-VLA 在强化学习中保护多任务策略。AffordVLA 在不加运行时模块的情况下学习接触区域。RoboFlow4D 为闭环控制加入快速 3D 运动计划。
当天最强的信号是具体执行。SaaSBench 和 WebGameBench 评估已交付的软件行为,而 ContraFix 和 MemRepair 通过把运行时证据和历史修复放进循环来改进修复。当前重点是运维层面:环境搭建、集成、验证和审查控制决定代理是否有用。
最强的信号是操作层面的评估。1GC-7RC、AgentKernelArena 和 TOBench 都在有工具、运行时检查和资源限制的封闭工作循环里给 agent 打分。同样的关注也出现在可靠性论文、供应链风险研究和 token 预算报告中。