HybridInfer:面向端、边、云协同大模型推理的热感知强化学习分层路由
该研究探讨了端侧小模型在连续推理时面临的硬件限制。作者在旗舰骁龙设备上发现,端侧持续生成不仅会导致降温降频,还因现有工具链(移动GPU上的OpenCL内核编译与长Prompt预填充)缺陷,导致GPU运行时在连续查询后崩溃或静默卡死。为此,研究提出了HybridInfer,采用热感知的强化学习策略,在端侧、边缘和云端之间进行动态分层路由,以兼顾本地隐私、成本与系统稳定性。
该研究探讨了端侧小模型在连续推理时面临的硬件限制。作者在旗舰骁龙设备上发现,端侧持续生成不仅会导致降温降频,还因现有工具链(移动GPU上的OpenCL内核编译与长Prompt预填充)缺陷,导致GPU运行时在连续查询后崩溃或静默卡死。为此,研究提出了HybridInfer,采用热感知的强化学习策略,在端侧、边缘和云端之间进行动态分层路由,以兼顾本地隐私、成本与系统稳定性。
研究人员提出了ENAS,一种面向超低功耗微控制器(TinyML)的硬件感知神经架构搜索框架。该框架结合了静态可行性检查、支持多种卷积块的基于单元搜索空间,以及“随机-Top-K-变异”的三阶段混合搜索策略与跨运行缓存。与依赖GPU加速的传统NAS不同,ENAS无需GPU即可高效运行,显著降低了端侧AI开发的算力门槛。