arXiv 人工智能· Gaurav Agarwal, Ashish Garg, Isha Singhal·· 5 小时前AI 评分36
解码延迟反馈预填充(DLFP):一种无模型控制器及其泛化边界
Decode-Latency Feedback Prefill: A Model-Free Controller and Its Generalization Limits
AI 导读
研究人员提出基于 vLLM 的无模型控制器 DLFP,通过延迟反馈动态调整与活跃解码重叠的预填充分块大小。在单张 A100 80GB GPU 运行 Qwen3-0.6B(BF16)测试中,DLFP 将 P99 inter-token latency 平均降低 27.7%,但平均 P99 首 token 时间增加 34.8%。
来源:arXiv 人工智能 · arxiv.org