软件代理研究对信号、证据和风险的要求更严了
这段时间最强的主题,是对软件代理的控制更紧了:训练用更干净的轨迹,评估用更好的日志,现实仓库和真实工作区里的代理行为也接受更难的测试。证据比标题党更务实。STITCH 说明更少但更有价值的轨迹能带来很大收益,而 GitHub 规模研究和安全研究把长期代码 churn 和 prompt injection 风险放到前台。
这段时间最强的主题,是对软件代理的控制更紧了:训练用更干净的轨迹,评估用更好的日志,现实仓库和真实工作区里的代理行为也接受更难的测试。证据比标题党更务实。STITCH 说明更少但更有价值的轨迹能带来很大收益,而 GitHub 规模研究和安全研究把长期代码 churn 和 prompt injection 风险放到前台。
这段时间的软件代理工作指向三项马上能做的流程改动:跟踪代理代码在合并后是否还能保留,发布可复用的运行包用于评估和训练,并把不可信内容隔离当作代理安全的一部分。共同点是更清楚地看到代理做了什么、保住了什么,以及周边脚手架允许了什么。