趋势

智能体研究正在把工作场所交付、上下文恢复和安全证据放到同一张记分卡上

日 · 2026-06-22 · Software Intelligence

当天证据最强的研究将大型语言模型(LLM)智能体视为生产系统,这类系统需要任务上下文、可复用流程和安全检查。DeepDiscovery、EnterpriseClawBench 和 AFTER 给出了最清楚的证据,包含具体任务、制品和迁移测试。

编码智能体的代码库上下文

DeepDiscovery 针对编码智能体中的一种常见失败:找到最显眼的文件,却漏掉注册代码、配置链接、测试或依赖注入路径。它的 Location-Inference 方法先从高置信度任务锚点出发,再在预算限制内沿显式依赖、隐式配置链接和模块邻近关系扩展。

论文报告的收益有实际意义。在包含 267 万行代码、超过 25,000 个文件的工业代码库中,它在中等任务上将 Full Recall Rate 提高 2.5 到 7.4 个百分点,在大型子项目任务上提高 1.6 到 9.2 个百分点。在 SWE-bench Verified 上,接入该方法的系统达到 78.6% 的求解率,比基线高 8.2 个百分点。

带制品和可复用技能的工作场所基准

EnterpriseClawBench 将企业内部会话转成可复现任务,任务包含文件、预期交付物、角色标签、规则,以及文本或视觉评分规程。32 个 harness-model 组合中的最佳 Lite 分数为 0.663,仍能看到许多制品交付和内容质量失败。该基准还报告成本、运行时间、工具调用和 harness-model 配对,因此基础模型分数不能掩盖执行问题。

AFTER 将过程记忆作为带版本的技能文件来研究。静态技能平均增加 2.8 个准确率百分点,一轮细化再增加 3.7 到 6.7 个百分点。用多样化多模型轨迹训练的技能达到 73.1% 的跨模型测试准确率,而范围较窄的技能更新在跨角色迁移时可能损失准确率。

AI 构建软件的安全证据

vibe-coding 安全研究给出了这一时期最大的警示信号。作者收集了 10,517 个主要由 AI 编写的应用,并审计了 200 个已部署的 Web 应用。经过去重和可利用性检查后,人工审查者验证了 1,471 个可利用漏洞。反复出现的缺陷类型包括访问控制破坏、加密失败、注入、密钥暴露、占位逻辑和未过滤输入。

EVerest 提供了另一类安全证据:一个公开数据集,将电动汽车充电栈的需求、架构、文档和代码连接起来。它包含 84 条安全需求和 1,445 个细粒度标签。在构建过程中,作者发现并披露了一个真实的 CWE-1295 明文令牌存储弱点。

专门工程任务中的领域上下文和人工审查

SysML v2 故障定位论文显示,当领域规则作为训练数据和推理上下文提供时,小型代码模型可以获得提升。一个车辆领域知识图谱编码物理接口和单位兼容性规则,然后指导合成故障生成和修复提示。在报告的评估集上,Qwen2.5 Coder 1.5B 在微调后的完整代码输出中达到 95.7% 的语义修复准确率,在补丁输出中达到 91.9%;其基线语义修复准确率为 0.62%。

WisdomAI 的 Text-to-SQL 文章对企业分析提出了相关的生产环境主张。它的 Adaptive Context Engine 使用 schema、日志、dbt、LookML、知识库、反馈和管理员审查来构建并更新业务上下文。在五个经过筛选的 LiveSQLBench 仅查询数据集上,报告的聚合准确率为:基线 20%,加入知识文件后 50%,上下文学习后 85%。

较新机器人 VLA 研究正在面向接触、安全限制和演示稀缺条件下的闭环可靠性较早机器人 VLA 研究正在用真实控制失效模式来评判