---
source: arxiv
url: http://arxiv.org/abs/2604.13109v1
published_at: '2026-04-11T03:22:21'
authors:
- Worasait Suwannik
topics:
- agentic-coding
- code-intelligence
- ai-for-research
- algorithm-optimization
- software-reproduction
relevance_score: 0.94
run_id: materialize-outputs
language_code: zh-CN
---

# Applying an Agentic Coding Tool for Improving Published Algorithm Implementations

## Summary
## 摘要
本文提出一个两阶段工作流：先用一个模型筛选合适的近期论文，再用 Claude Code 复现并改进它们公开的实现。作者在 11 个已发表的算法实现上都报告了改进，而且每个案例都在一个工作日内完成，但他们也说明，这些结果没有在代理环境之外独立验证。

## 问题
- 许多研究论文现在会公开代码和数据，但关于代理式编码工具能否接手已发表实现、复现结果，并把性能推进到论文基线之上，证据还很少。
- 这很重要，因为已发表的实现为 AI 辅助研究、复现和算法增量改进提供了大量具体、可运行的目标。
- 论文还想回答：当代理已经能搜索、写代码、跑实验并记录迭代时，人还需要做哪些工作。

## 方法
- 这个工作流分成两个阶段：发现阶段和改进阶段。
- 在发现阶段，ChatGPT Deep Research 按明确筛选条件检索论文：GitHub 上有 Python 或 C++ 代码、公开数据集、在约 30 秒内至少能在两个数据集上完成运行，以及 2021 年后发表于 Q1 或 Q2 期刊。
- 在改进阶段，Claude Code 读取论文 PDF，选择一个指标-数据集组合，复现基线，然后最多迭代 20 次，每次都保存代码、结果和简短计划。
- 当代理在选定目标上超过论文报告结果时就停止。日志文件的目的在于让每个实验都可审计。
- 这项研究把这个流程用于 11 个领域，包括组合优化、可解释 AI、模式挖掘、图像分割、数据流、分布式系统、网络安全、图机器学习、分子模拟、计算物理和生物信息学。

## 结果
- 主要结果是 11 个实验全部都比选定的已发表基线更好，而且每个报告的改进都在一个工作日内达到。
- 报告的量化收益包括：组合优化中运行时间快 193 倍，模式挖掘中运行时间快 6.4 倍，在高 K 且达到全局最优时图像分割速度快 1000 倍以上，分布式系统中的查找延迟快 2 倍以上，以及生物信息学中典型情况下快 10.5 倍、在大规模实例上快 34.3 倍。
- 其他报告的收益包括：图机器学习中的准确率提高 8%，网络安全中的防御成功率提升一倍以上，数据流在 10 KB 时的 F1 更高，可解释 AI 中稀疏性更低，以及分子模拟中在所有测试值上的动力学温度误差更低。
- 论文也给出重要限制：作者没有逐行独立审计生成代码，没有在 Claude Code 的环境之外重新运行结果，并把模型报告的输出当作初步结果。
- 有些比较看起来比实际更强。网络安全结果使用了 50 个基准网络，而论文用了 200 个，并且依赖一个替代模拟器，因为原始引擎是专有的。图机器学习中的改进来自替换原始方法，而且代理运行了 38 次迭代，虽然提示词设定的上限是 20 次。
- 论文的更广泛结论是：在人选定目标、检查实验是否有效、判断新颖性和影响、提供算力和访问权限、管理执行风险以及撰写披露说明时，人工工作仍然重要。

## Problem

## Approach

## Results

## Link
- [http://arxiv.org/abs/2604.13109v1](http://arxiv.org/abs/2604.13109v1)
