AiNews
⚡ 速览 🧠 模型
← 返回首页

#kv-cache

包含标签 "kv-cache" 的文章,共 5 篇。

🧠 模型动态 Reddit

开发者从零训练2.5亿参数量化大模型

开发者基于 FineWeb 数据集的 30B token,从零训练了一个 2.5 亿参数的大语言模型。通过低于 2-bit 的量化技术,模型部署包体积压减至 60 MB 以内,运行时内存占用约 80 MB,在普通笔记本 CPU 上不依赖 GPU 即可实现约 400 tok/s 的推理速度。在长文本处理上,该模型采用分层架构:最近 2048 个 token 维持常规 fp16 的 KV cache,早期历史数据则压缩至 1-bit 并持久化到磁盘(约 320 字节/token),令 100 万 token 的上下文历史仅需约 320 MB 磁盘空间,验证了小型量化模型在边缘端与长文本场景的落地潜力。

🧠 模型动态 Reddit

大模型 KV 缓存混合技术的实践与效果

Reddit 开发者近期讨论了一种 KV 缓存混合技术。该方法改变了传统的预填充流程,不再对整个提示词进行完整预填充,而是将其拆分独立生成不同部分的缓存,随后拼接输入解码阶段。在 Ling3-tiny 的非 KDA 层测试表明,只要分块保持适当的重叠度,模型不仅能保持“大海捞针”式的信息检索能力,还能跨分割区域进行综合推理。这为长文本处理与计算优化提供了一种可行的技术探索方向。

🛠️ 开发工具 Reddit

vLLM 运行 Qwen 启用 KV 缓存卸载配置排错

Reddit LocalLLaMA 社区近期讨论了在 vLLM 中为 Qwen 系列模型开启 KV 缓存卸载(KV cache offloading)时遇到的报错与崩溃问题。多位开发者在尝试不同参数组合时均告失败,官方文档对该架构的实际支持情况也存在模糊之处。这反映出本地部署大模型在优化显存占用时,推理框架与特定模型架构的兼容性调试仍是痛点,相关讨论为解决此类硬件资源管理难题提供了实际参考。

🧠 模型动态 Reddit

LFM2.5-2.6B 模型与 KV 缓存量化评测

Liquid AI 推出的 LFM2.5-2.6B 模型在轻量化架构中备受关注。本测试针对该模型的权重及 KV 缓存展开不同精度的量化验证,重点考察显存占用、推理吞吐量与生成质量之间的平衡。测试数据表明,合理的量化方案能在几乎不损失模型能力的前提下,显著降低本地部署和边缘端设备的硬件门槛,为资源受限场景下的模型落地提供直接的性能参考。

🧠 模型动态 Reddit

KVarN:方差归一化KV缓存量化

KVarN是一种新颖的KV缓存量化方法,旨在大幅提升大型语言模型在推理阶段的效率。该技术的核心在于结合了Hadamard旋转与对K和V矩阵双轴的方差归一化处理,随后进行四舍五入量化。这种方法虽然实现简单,但在实际应用中表现出色。 KVarN特别适用于解码密集型、测试时扩展(test-time-scaling)场景,例如复杂的推理任务、代码生成以及AI Agent应用。在这些场景下,KV缓存的内存占用和访问速度是关键瓶颈。通过KVarN,开发者可以实现3到4倍的KV缓存压缩,同时在AIME24等严苛基准测试中,模型准确率几乎没有下降,通常仅有0-1%的损失。 这项技术不仅显著减少了KV缓存的内存消耗,还带来了推理速度的提升,优于现有量化方法。对于追求高效部署大型模型、支持更长上下文窗口以及优化AI Agent性能的中国开发者和AI创业者而言,KVarN提供了一个极具价值的解决方案,有助于降低运营成本并加速应用迭代。