- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月6日 15:07
- 状态
- 单一信源
01
发生了什么
arXiv 上发布了一篇论文,针对 LLM 推理调度的 WAIT 算法提出轻量扩展,以适应突发性、动态变化的工作负载。该算法基于到达间隔在线估计请求强度,并在模拟的 MM PP 合成工作负载中评估,表明在低到达率场景下能比 Sarathi-Serve、ORCA 和 vLLM 实现更高吞吐量,同时保持相似延迟。
02
为什么重要
此前调度算法多假设请求到达率恒定,与实际流量不符。该研究提出在线适应到达率变化的新方法,可能提升真实场景下的推理吞吐量,对产品性能和成本有潜在影响。
03
底层逻辑
通过观察请求到达间隔,在线估计当前请求强度,并据此动态调整调度策略,以应对突发流量和到达率变化,从而在低负载波动场景下提升吞吐量并维持低延迟。
04
产品与商业机会
若算法成熟,可提升推理服务在高波动场景下的吞吐量,降低排队延迟和计算成本,尤其适合负载波动大的产品。但尚未在真实环境验证,实际影响待定。
- 在负载波动大的推理服务中试运行该算法,评估吞吐量提升效果。
- 结合真实流量数据回放,对比 Sarathi-Serve、ORCA 和 vLLM 的性能差异。
05
仍待确认
- 算法在中高到达率或极端突发场景下表现如何?
- 是否在真实推理引擎中实现并验证?
- 对多类型请求和优先级调度的兼容性如何?