在 agent 系统承担更多责任之前,它们需要可检查的执行过程
最强信号是,agent 需要可检查的执行过程和更严格的任务证据。DuST 把带执行标签的候选代码当作训练数据,Shepherd 记录实时 agent 状态以便分叉,ComplexMCP 则显示工具型 agent 在有状态软件工作上仍落后于人类。
最强信号是,agent 需要可检查的执行过程和更严格的任务证据。DuST 把带执行标签的候选代码当作训练数据,Shepherd 记录实时 agent 状态以便分叉,ComplexMCP 则显示工具型 agent 在有状态软件工作上仍落后于人类。
Agent 团队可以通过在 agent 已经容易出错的地方增加轨迹、状态和来源检查来提速:编码运行、MCP 工具工作流,以及把未受信任文本与密钥或 shell 访问混在一起的自动化工作流。
当天最强的主题是围绕 LLM 编码系统的控制。新工作尝试压缩到真正相关的代码,追踪自然语言/程序边界上的流动,并用更严格的权限限制代理动作。它们在修复和分析基准上都有可量化的收益,但证据也表明,单靠更强的定位或更多上下文,仍然补不上剩下的质量差距。
围绕 LLM 编码系统,三条控制点上的具体工作正在成形:在修复前压缩仓库上下文、在 LLM 调用边界上恢复污点和切片、以及限制编码代理在开发者机器上能碰什么。证据最强的是那些报告了修复准确率、分析质量或操作工作流可测效果的论文;安全工具还处在早期的地方,证据较弱,但已经具体到可以直接测试。