AI 软件论文优先关注可测量的置信度和受控的 agent 运行时
当天的研究把 AI 软件工作当作一个工程控制问题。最强的论文会在生成代码和 agent 行动周围加入可测量的置信度、上下文限制和可追踪验证。《Code Is More Than Text》、FASE 和 Less Context, Better Agents 给出了最清晰的量化信号。
当天的研究把 AI 软件工作当作一个工程控制问题。最强的论文会在生成代码和 agent 行动周围加入可测量的置信度、上下文限制和可追踪验证。《Code Is More Than Text》、FASE 和 Less Context, Better Agents 给出了最清晰的量化信号。
代理式软件工作有三个可用的控制点:生成代码可以在进入评审或另一个代理前先打分,MCP 代理可以用截断的最近工具历史加简短摘要运行,AI 生成测试可以在构建、执行、覆盖率、突变和修复步骤中保留候选级证据。
当前重点:编码 agent 按运行方式、修复能力和边界内行为来评判。A-ProS 展示了有状态评审反馈带来的提升。ProcBench 对轨迹中的过程缺陷打分。OverEager-Bench 衡量 benign 任务中的未授权动作。
编码代理团队可以把运行时范围、轨迹质量和文件选择分开测试。证据支持在更广泛部署前先做几项实操检查:捕捉越界动作、给代理日志里的流程缺陷打分,以及在迭代修复前缩小修复上下文。
这一天最清楚的模式,是对编码系统的控制更紧了。论文更多依赖测试、运行时仪表和更窄的定位方式,让输出更容易打分和检查。ZeroCoder 给出了最强的量化结果,而安全和代理论文一直在追问同一个实际问题:模型应该看到哪些证据,人又该怎样验证它实际用了什么?
这组内容里最实用的变化是三个方向:围绕可执行测试构建的代码训练循环、面向小型内部软件的测试审查式工作流,以及针对编码代理审计的运行时覆盖检查。它们都把模型输出绑定到团队能核查的东西上:通过/失败矩阵、审查过的测试,或行级读取覆盖。