Formal specification and requirements validation
大型语言模型(LLM)正在规格化任务上接受测试,这类任务里,一个看起来合理的答案还不够。LiveFMBench 用 Frama-C、Alt-Ergo 和 Z3 检查 C 程序的 ANSI/ISO C Specification Language(ACSL)契约,然后过滤掉那些改动了程序或断言的输出。这个过滤会让报告的直接提示准确率下降约 20%,而循环不变式仍然是主要失败类型。
需求工具也偏向受约束的生成。ClarifySTL 在生成 Signal Temporal Logic(STL)前,先让用户澄清模糊的时间范围、阈值和引用。它在 DeepSTL 和 STL-DivEn 上报告了两位数的准确率提升。另一个 OOMRAM 需求代理使用确定性的 Python 验证器拒绝无效的需求组合;最终输出在 10 个项目设想中达到了 100% 的结构有效性,但没有做到与金标准完全匹配。