小模型工作流迁移的 Harness 适配门槛
运行预算审批等重复性工作流的团队,应先用特定于任务的 harness 测试小型语言模型,再决定是否承担前沿模型的推理成本。Harness 优化器可以检查失败轨迹,并修改指令、工具可用性、上下文选择、钩子和编排循环。在报告的预算审批任务中,经过适配的 Gemma-4-26B-A4B 配置准确率达到 98.3%,高于默认 harness 的 75.0%,也高于报告中的 Gemini-3.1-Pro 的 97.3%。在 21 个任务-模型组合中,适配提升了其中 16 个的表现,并在 7 个组合中消除了测得的差距。
实际的采用门槛可以是一组来自单个高流量工作流的回放样本,并按实例多样性和操作边界情况进行划分。比较前沿模型代理、使用当前 harness 的小模型,以及经过适配的小模型代理在任务准确率、契约违规、延迟和每个完成案例的成本上的表现。对于超出已验证工作流范围的案例,保留前沿模型作为回退方案。研究发现,重复性任务和能力更强的小模型获得的收益更大,因此在将节省成本的估算用于容量规划前,需要使用多样化的留出集进行验证。