AIDC
← 返回全部动态
arXiv 人工智能AI 评分 72/10009月29日 12:00

基于接收端条件化的多智能体隐式通信方法 CacheBack:压缩高达94%的KV缓存

针对多智能体系统中直接传输KV缓存带来的显存开销线性增长、超出GPU资源限制的问题,研究团队提出了一种接收端条件化的隐式通信方法。该方法在保留隐式通信低延迟、无需文本生成且信息无损优势的同时,针对接收端需求进行针对性优化,实现了高达94%的KV缓存压缩与回退,大幅降低了多智能体协作中的上下文与显存负担。

推荐理由针对多智能体系统在隐式通信(KV Cache传递)中面临的高昂显存成本问题提出了高压缩比优化方案,具有实用价值。

原标题:Receiver-Conditioned Latent Communication gives 94% CacheBack

阅读 arXiv 人工智能 原文 ↗

同一事件的其他来源

arXiv 自然语言处理09月28日 12:00

超越均值注意力:面向大模型 KV Cache 驱逐的多样性感知与分层评分机制

现有如 SnapKV 和 PyramidKV 等 KV Cache 驱逐方法通常仅根据观察窗口内的平均注意力权重对 Token 进行排序。该研究提出了一种统一评分机制,引入了窗口查询中的注意力离散度以及相对于已选 Token 的冗余度惩罚,在无需额外前向传播的情况下平衡相关性与多样性。同时,研究还探索了随网络深度变化的分层评分系数配置,以优化大模型长上下文推理时的缓存保留效果。