实际限制现在是 AI 编码研究的主线
今天的编码研究最强的部分是对实际限制的说明。RealBench 显示 repo 级生成在完整项目上仍然会失效,token 成本研究显示 agentic coding 可能比聊天式帮助贵得多。最可信的改进来自更紧的结构:验证器反馈、自适应检索,以及围绕数据库访问的明确防护。
今天的编码研究最强的部分是对实际限制的说明。RealBench 显示 repo 级生成在完整项目上仍然会失效,token 成本研究显示 agentic coding 可能比聊天式帮助贵得多。最可信的改进来自更紧的结构:验证器反馈、自适应检索,以及围绕数据库访问的明确防护。
最清楚的短期变化都在执行层面。编码代理产品需要在运行中有明确的 token 控制,仓库规模生成在项目变大后需要按依赖顺序工作流,而维护团队可以为把需求链接到代码、并带上更小上下文和可见证据的追踪层找到理由。
这一天最清楚的信号是,编码代理工作正在收紧到可执行证明上。AgentForge、AnyPoC 和 AnalysisBench 都把模型输出当作草稿,要求它先通过具体检查:沙箱执行、可复现的分析输出,或重新运行的概念验证。这种重点与近期关于控制面和验证的一批论文一致,但这组工作更明确地指向最终必须存在的工件:一个通过的补丁、一个有效的分析结果,或一个能触发漏洞的测试。
可执行检查正在进入编码和分析工作流的交付工件。眼下最清楚的落地方向,是给代理生成的补丁加 CI 凭证、给安全报告分流加 PoC 验证器,以及给难配置的分析工具加分阶段 runbook 代理,用可复现的证据把它们跑起来。