跳到正文
热点事件持续更新

研究团队提出HALO调度方案优化LoRA本地部署吞吐与SLO

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月6日,研究人员在arXiv发布面向LoRA辅助本地大语言模型部署的调度方案HALO,旨在解决多任务并发场景下的资源争用问题,在保障异构服务等级目标(SLO)的同时提升吞吐量。HALO通过划分GPU流式多处理器(SM)重叠Base与LoRA计算以实现空间复用,并结合基于请求级松弛时间的SLO感知调度器优先处理紧急任务。评估结果显示,HALO有效缓解了资源争用,在大幅减少SLO违规的同时提高了系统吞吐量。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. arXiv 自然语言处理
    从过载到保障:面向 LoRA 辅助本地 LLM 部署的高吞吐多 SLO 调度方案 HALO

    研究人员提出针对 LoRA 辅助本地大语言模型部署的调度方法 HALO,旨在多任务并发下保障异构服务等级目标(SLO)并提升吞吐量。该方法通过划分 GPU 流式多处理器(SM)重叠 Base 与 LoRA 计算以实现空间复用,并结合基于请求级松弛时间的 SLO 感知调度器优先处理紧急任务。评估表明 HALO 有效缓解了资源争用,在大幅减少 SLO 违规的同时提高了系统吞吐量。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。