Reddit
大模型 KV 缓存混合技术的实践与效果
Reddit 开发者近期讨论了一种 KV 缓存混合技术。该方法改变了传统的预填充流程,不再对整个提示词进行完整预填充,而是将其拆分独立生成不同部分的缓存,随后拼接输入解码阶段。在 Ling3-tiny 的非 KDA 层测试表明,只要分块保持适当的重叠度,模型不仅能保持“大海捞针”式的信息检索能力,还能跨分割区域进行综合推理。这为长文本处理与计算优化提供了一种可行的技术探索方向。
获取每日 AI 情报与羊毛福利
加入 Telegram 频道 @ainews_Go,第一时间接收精选资讯推送。