长上下文控制
当每轮都重新计算完整历史,或有用信息变得难以检索时,大上下文窗口的价值就会受限。qMLX 从磁盘恢复键值(KV)注意力状态,并修复前缀匹配和中断历史记录方面的错误。在一台 M3 Ultra 上,32,000 个 token 的重复预填充时间从 88 秒降至 0.64 秒;在 168,000 个 token 的上下文中,一次简短的后续请求在 2.6 秒内生成了首个 token。
ContextOps 在大型语言模型(LLM)运行前检查重复的检索块、提示词增长、来源集中度和 token 分布不均。其示例发现了 214 个重复 token,估计可节省 12% 的 token。另一段社交媒体摘录称,检索率从 256,000 个 token 时的 80% 降至 100 万个 token 时的 36%,但没有提供数据集或评测协议。这些材料共同支持更严格的上下文测量;只有 qMLX 报告提供了详细的运行时测量,而且数据来自单台机器。