Executable solvers and world models
ReaComp 给出的效率结果最清楚。它把每个基准大约 100 条 LLM 推理轨迹转成可复用的 Python 符号求解器。在 PBEBench-Hard 上,符号集成在测试时不使用 LLM token 的情况下达到 84.7% 准确率,而 Best-of-K 为 68.4%。这个混合方案还把报告的 token 使用量减少了 78%。
ARC-AGI-3 的工作把同样的方法用到交互式游戏上。编码代理先写 Python 世界模型,再用观测到的状态转移检查它,在模型内做规划,只有在预测仍然一致时才执行动作。在 25 个公开游戏上,它完整解决了 7 个,但不同运行之间差异很大,而且还没有私有集结果。
UVMarvel 把这个模式扩展到硬件验证。它为 subsystem-level RTL 构建 Universal Verification Methodology (UVM) 测试平台,然后用覆盖率报告和信号追踪让 LLM 生成新序列。论文报告六个 subsystem 基准上的平均代码覆盖率为 95.65%。