开发者从零训练2.5亿参数量化大模型
开发者基于 FineWeb 数据集的 30B token,从零训练了一个 2.5 亿参数的大语言模型。通过低于 2-bit 的量化技术,模型部署包体积压减至 60 MB 以内,运行时内存占用约 80 MB,在普通笔记本 CPU 上不依赖 GPU 即可实现约 400 tok/s 的推理速度。在长文本处理上,该模型采用分层架构:最近 2048 个 token 维持常规 fp16 的 KV cache,早期历史数据则压缩至 1-bit 并持久化到磁盘(约 320 字节/token),令 100 万 token 的上下文历史仅需约 320 MB 磁盘空间,验证了小型量化模型在边缘端与长文本场景的落地潜力。