主题概况

Code Generation

第 1 / 2 页
趋势
7
想法
7
最近一期
2026-05-27
想法 · 日 · 2026-05-19 · Software Intelligence

Agent State Verification

Agent 部署正在获得具体的控制点:并行编码代理的写入时状态检查、桌面任务的可执行状态验证器,以及用于选择或延后生成代码的运行时证据。共同模式很简单:记录代理看到的内容,把动作和当前状态对齐检查,并在系统拒绝或转派输出时保留机器可读的原因。

趋势 · 日 · 2026-04-09 · Software Intelligence

编码研究正在围绕测试、运行时可见性和精确定位收紧

这一天最清楚的模式,是对编码系统的控制更紧了。论文更多依赖测试、运行时仪表和更窄的定位方式,让输出更容易打分和检查。ZeroCoder 给出了最强的量化结果,而安全和代理论文一直在追问同一个实际问题:模型应该看到哪些证据,人又该怎样验证它实际用了什么?

想法 · 日 · 2026-04-09 · Software Intelligence

可验证的代码生成工作流

这组内容里最实用的变化是三个方向:围绕可执行测试构建的代码训练循环、面向小型内部软件的测试审查式工作流,以及针对编码代理审计的运行时覆盖检查。它们都把模型输出绑定到团队能核查的东西上:通过/失败矩阵、审查过的测试,或行级读取覆盖。

趋势 · 日 · 2026-04-08 · Software Intelligence

软件代理工作正在更明确地强调规格、检查和整仓库任务

当天最强的证据支持这样一种软件代理:它先写下任务,在仓库尺度上行动,并通过具体检查。ReCodeAgent 和 REAgent 在生成前加入规划或需求后,拿到了可测的提升。CLI-Tool-Bench 和 SWD-Bench 则把评测收紧到端到端行为、仓库理解和下游可用性上。

想法 · 日 · 2026-04-08 · Software Intelligence

仓库任务验证

最近最清楚的方向,是在仓库代理前面加上明确的规格和验证步骤,再用端到端的仓库任务来测试它们,而不是只做局部代码检查。证据支持三个具体动作:在修 issue 之前先写结构化需求,把仓库迁移包装成带规划和验证检查点的流程,以及用空工作区的黑盒 CLI 行为测试来评估 0 到 1 的代码生成。

想法 · 日 · 2026-03-31 · Software Intelligence

可执行的语义检查

当模型输出被转成代码可以执行、评分或拒绝的检查时,软件工具会更有用。近期最清晰的产品方向是面向命令式例程的验证式代码生成,以及和测试行为绑定的语义故障定位。另一个更窄的训练方向也可行:在专有任务上,先按执行行为过滤自生成代码样本,再做偏好微调。