KV缓存
4 条- 01共享全局KV缓存与层特异性局部历史
提出混合KV缓存机制,在共享全局键值基础上保留层特异性局部历史,降低解码困惑度。
- 02风险控制的KV缓存驱逐:从内存预算到风险目标
将KV驱逐重构为风险控制问题,以任务效用下降超阈值的请求发生率为部署风险指标。
- 03Flash-dLLM:面向IO感知的KV缓存与并行解码,实现快速、内存高效的扩散型大语言模型
提出Flash-dLLM框架,通过IO感知KV缓存和并行解码提升扩散型LLM推理效率与内存利用率。
- 04把记忆交给CPU,大模型会变快
提出CPU卸载KV缓存方案,降低GPU显存压力,提升大模型推理吞吐与效率。