Reddit
在 CPU 上高效运行 Qwen3.5 0.8B 的工程实践
为了在 GPU 满载时分担语音听写文本的清理工作,开发者尝试将 Qwen3.5 0.8B 部署到本地 CPU 环境。项目借助 Codex 编写了一个专用的 C++ 推理引擎,并设计了名为 H128/Q4-G32-DOT4 的自定义 4 比特量化方案。该方案结合了基于激活值的校准与块级误差补偿技术,在将模型体积压缩至 425 MB 的同时,保持了极佳的推理性能,充分展现了微型开源模型在边缘和本地 CPU 上的实用价值。
获取每日 AI 情报与羊毛福利
加入 Telegram 频道 @ainews_Go,第一时间接收精选资讯推送。