Compatibility tests for hosted LLM model updates
使用托管 LLM API 的应用团队应该为那些可能破坏生产行为的提示词保留一套小型回归测试。测试集应包括有效 JSON、仅输出代码、通过单元测试,以及认证或数据验证相关的安全规则等契约。每次测试运行都应记录可见的模型名称、时间戳、提示词版本、输出,以及通过或失败结果。
有用的单位是应用需求,而不是提供商的基准分数。那篇 LLM 供应链论文在七个 Claude 模型上测试了 25 个提示词,覆盖认证、数据验证和结构化输出,每个提示词运行了三到五次。结构化 JSON 任务的漂移比 SQL 和认证任务更明显,失败形式包括空 JSON、异常类型变化、原本应输出 Python 却输出 JavaScript,以及被元数据包裹的输出。一个后端 SQL 函数在 Sonnet 4 上通过了测试,第二天却在安全编码测试中失败。
一个低成本的起点,是对那 20 到 50 个会写代码、产出机器可读输出,或接触安全敏感路径的提示词做夜间检查。只要某个必需类别低于阈值,这个工作流就可以继续阻止模型更新,然后再通过修改提示词、切换回退路由,或重新验证来推进。