代码智能体需要可执行证明、有边界的工作循环和可审计轨迹
本周的代码智能体研究提高了有用工作的评测门槛。SWE-Cycle 和 SaaSBench 对设置、集成、测试和交付行为评分。Rollout Cards 为智能体运行增加报告规范。共同要求很直接:智能体需要拿出证据,证明任务是在真实运行约束下完成的。
本周的代码智能体研究提高了有用工作的评测门槛。SWE-Cycle 和 SaaSBench 对设置、集成、测试和交付行为评分。Rollout Cards 为智能体运行增加报告规范。共同要求很直接:智能体需要拿出证据,证明任务是在真实运行约束下完成的。
本周研究把大语言模型(LLM)编码代理视为需要先给出证据才能被信任的系统。最有力的工作通过执行、仓库任务、形式化证明、工具契约和对抗性安全测试来检查生成代码。SWE Atlas、VeriContest 和 RubricRefine 展示了同一个实用标准:有用的代理必须留下可检查的证据,处理常规工程工作,并避免不安全操作。