Benchmarks that test the work artifact
C2VEval 显示,当任务文本泄露答案时,视觉到代码基准会高估能力。在 circuit-to-Verilog 生成里,sum、cout 或 fsm_3state 这类模型头让多模态 LLM(MLLM)不用看图也能生成看起来合理的寄存器传输级代码。作者把图像换成空白图后,Mirage 模式在评估的 8 个 MLLM 上都追平或超过了真实图像模式。把标识符匿名化后,GPT-5.4 的 Functional Pass@1 从 45.51% 降到 24.55%,Opus 4.6 从 52.69% 降到 11.38%。
Claw-Eval-Live 把同样的证据优先思路用到工作流代理上。它用轨迹、审计日志、服务状态、运行后文件、命令轨迹和测试来评估 105 个任务。Claude Opus 4.6 以 66.7% 的通过率领先,没有一个评估模型达到 70%。这给今天围绕工作流自动化的说法划出一个明确上限,尤其是人力资源、管理和跨系统业务任务。