面向变更与覆盖缺口的测试
当测试生成以具体的执行目标为锚点时,基于 LLM 的测试正变得更加有效。DiffTestGen 利用调用图、文档和覆盖率反馈来触达修改后的 Python 代码。在 463 个拉取请求中,它发现了其中 78.2% 的行为差异,平均联合覆盖率达到 90.7%。
GapForge 将同样的目标定位逻辑应用于编译器覆盖缺口。它推断触达未覆盖区域所需的程序结构和编译器选项。在 72 小时的运行中,它比 WhiteFox 多覆盖了 24,736 行 GCC 代码和 19,798 行 LLVM 代码,并发现了 12 个编译器故障。这些结果进一步支持了近期关于可执行检查的证据,表明反馈的位置和结构很重要,而不仅仅是是否存在测试循环。