arXiv 自然语言处理· Zeshen Zhang, Han Zhao, Weihao Cui, Quan Chen, Yu Liu, Yongjun Deng, Jing Yang, Jiuchen Shi, Chen Chen, Youmin Chen, Yu Feng, Minyi Guo·· 3 小时前AI 评分34
从过载到保障:面向 LoRA 辅助本地 LLM 部署的高吞吐多 SLO 调度方案 HALO
From Overloaded to Guaranteed: High-Throughput Multi-SLO Enforcement for LoRA-Assisted On-Premise LLM Deployment
AI 导读
研究人员提出针对 LoRA 辅助本地大语言模型部署的调度方法 HALO,旨在多任务并发下保障异构服务等级目标(SLO)并提升吞吐量。该方法通过划分 GPU 流式多处理器(SM)重叠 Base 与 LoRA 计算以实现空间复用,并结合基于请求级松弛时间的 SLO 感知调度器优先处理紧急任务。评估表明 HALO 有效缓解了资源争用,在大幅减少 SLO 违规的同时提高了系统吞吐量。
来源:arXiv 自然语言处理 · arxiv.org