并行编码代理的 HTTP 调度代理
用于编码代理的本地代理已经是可落地的构建,不是研究草图。HiveMind 在现有代理和模型 API 之间加入调度和重试层,代理端不用改代码,并且报告在七个场景里,拥塞时失败率从 72%–100% 降到 0%–18%。在重放的 11 代理案例中,完整 HiveMind 达到 0% 失败;去掉重试后,失败率又回到 63.6%。这说明,对已经在共享模型配额上并行做代码生成、修复或测试编写的团队来说,这里有一个明确的产品切入点:把 admission control、带抖动的重试、反压、token 预算和按任务优先级放到同一个代理里。最先会用上的,是已经看到代理在 429、502 和连接重置中退出的平台团队和开发者体验团队。一个低成本的验证方法很直接:把一条繁忙的内部工作流重放到代理后面,对比完成率、死代理造成的 token 浪费和总耗时,再和直接访问 API 的结果比较。