AiNews
⚡ 速览 🧠 模型
返回首页
Reddit

llama.cpp 新增 --n-cpu-ffn 选项

llama.cpp 近期通过 PR #26622 引入了 `--n-cpu-ffn` 参数。该功能允许开发者在推理时将模型的前馈网络(FFN)层单独指定到 CPU 上运行。在显存紧张的本地部署场景下,这一特性可以灵活卸载计算负载,在 GPU 显存占用和推理性能之间找到平衡点,优化多硬件环境下的资源分配。

获取每日 AI 情报与羊毛福利

加入 Telegram 频道 @ainews_Go,第一时间接收精选资讯推送。

立即加入

相关阅读