来源笔记

Applying an Agentic Coding Tool for Improving Published Algorithm Implementations

Agentic CodingCode IntelligenceAI For ResearchAlgorithm OptimizationSoftware Reproduction

本文提出一个两阶段工作流:先用一个模型筛选合适的近期论文,再用 Claude Code 复现并改进它们公开的实现。作者在 11 个已发表的算法实现上都报告了改进,而且每个案例都在一个工作日内完成,但他们也说明,这些结果没有在代理环境之外独立验证。

  • 许多研究论文现在会公开代码和数据,但关于代理式编码工具能否接手已发表实现、复现结果,并把性能推进到论文基线之上,证据还很少。
  • 这很重要,因为已发表的实现为 AI 辅助研究、复现和算法增量改进提供了大量具体、可运行的目标。
  • 论文还想回答:当代理已经能搜索、写代码、跑实验并记录迭代时,人还需要做哪些工作。
  • 这个工作流分成两个阶段:发现阶段和改进阶段。
  • 在发现阶段,ChatGPT Deep Research 按明确筛选条件检索论文:GitHub 上有 Python 或 C++ 代码、公开数据集、在约 30 秒内至少能在两个数据集上完成运行,以及 2021 年后发表于 Q1 或 Q2 期刊。
  • 在改进阶段,Claude Code 读取论文 PDF,选择一个指标-数据集组合,复现基线,然后最多迭代 20 次,每次都保存代码、结果和简短计划。
  • 当代理在选定目标上超过论文报告结果时就停止。日志文件的目的在于让每个实验都可审计。
  • 这项研究把这个流程用于 11 个领域,包括组合优化、可解释 AI、模式挖掘、图像分割、数据流、分布式系统、网络安全、图机器学习、分子模拟、计算物理和生物信息学。
  • 主要结果是 11 个实验全部都比选定的已发表基线更好,而且每个报告的改进都在一个工作日内达到。
  • 报告的量化收益包括:组合优化中运行时间快 193 倍,模式挖掘中运行时间快 6.4 倍,在高 K 且达到全局最优时图像分割速度快 1000 倍以上,分布式系统中的查找延迟快 2 倍以上,以及生物信息学中典型情况下快 10.5 倍、在大规模实例上快 34.3 倍。
  • 其他报告的收益包括:图机器学习中的准确率提高 8%,网络安全中的防御成功率提升一倍以上,数据流在 10 KB 时的 F1 更高,可解释 AI 中稀疏性更低,以及分子模拟中在所有测试值上的动力学温度误差更低。
  • 论文也给出重要限制:作者没有逐行独立审计生成代码,没有在 Claude Code 的环境之外重新运行结果,并把模型报告的输出当作初步结果。
  • 有些比较看起来比实际更强。网络安全结果使用了 50 个基准网络,而论文用了 200 个,并且依赖一个替代模拟器,因为原始引擎是专有的。图机器学习中的改进来自替换原始方法,而且代理运行了 38 次迭代,虽然提示词设定的上限是 20 次。
  • 论文的更广泛结论是:在人选定目标、检查实验是否有效、判断新颖性和影响、提供算力和访问权限、管理执行风险以及撰写披露说明时,人工工作仍然重要。