长上下文编码会话的 KV 缓存回归测试
本地推理维护者应像测试模型吞吐量一样认真地测试对话状态。qMLX 将数分钟的后续响应延迟追溯到服务端的三个错误:变化的消息 ID 破坏了字节级精确的前缀匹配,被中断的助手回复从历史记录中消失,检查点淘汰丢弃了可复用的状态。在一台 M3 Ultra 上,磁盘恢复将 32,000 个 token 的重复预填充时间从 88 秒降至 0.64 秒。
实用的回归测试套件应重放固定的编码会话,中断生成后再恢复,并在每轮之后记录缓存命中长度、预填充的 token 数量和首 token 延迟。当稳定的提示词前缀意外变化,或服务端历史记录与客户端对话记录不一致时,测试应失败。团队可以先在支持的硬件上运行 32,000 token 和 100,000 token 的轨迹;qMLX 的测量结果来自一台机器,在进行容量规划前需要复现。