面向多机器人工厂任务的符合 SLO 的模型服务调度器
运行 VLA、规划器、安全模型和监控模型的工厂机器人团队,在为每台机器人购买一条专用加速器路径之前,应先测试带任务级 SLO 的共享 GPU 服务池。ROSA 给出了具体工作流:用声明式任务文件记录机器人队列、模型组件、提示词、调用率、重试规则,以及停止、重发、重新规划或呼叫人工等回退动作。调度器再根据符合 SLO 的动作吞吐量,选择模型放置、请求路由、批处理和每个任务的动作率。
一种低成本验证方法是把已记录的机器人观测回放到当前服务设置和一个 Ray Serve 风格的共享池中,然后只统计在任务 SLO 内到达、且能让机器人安全继续工作的动作。ROSA 报告称,在 8 块 NVIDIA H200 GPU、最多 64 个虚拟机器人的设置下,相比每台机器人分配专用服务的基线,符合 SLO 的工厂生产率最高提升 12.06 倍;相比使用同一服务基础设施但没有 ROSA 调度器的共享服务器基线,合格的工厂动作吞吐量最高提升 2.44 倍。采用障碍很具体:降低模型延迟只有在改变安全任务进展时才有用,而工厂负载包含机器人执行物理动作时的空闲时间,专用 GPU 分配会浪费这些时间。