AiNews
⚡ 速览 🧠 模型
返回首页
Reddit

Qwen3.8-Flash-Next 在双 3090 上的推理性能优化实践

在双 RTX 3090 GPU 与 DDR4 内存环境下,针对 Qwen3.8-Flash-Next 模型进行推理性能优化的技术细节。作者通过 llama.cpp 框架,结合 UD-Q4_K_XL 量化、专家缓存(expert cache)技术以及 MTP(Multi-Token Prediction)堆叠,成功将解码速度从 25-29 t/s 提升至 37-41 t/s。 核心技术要点包括: 1. 硬件配置:利用双 RTX 3090(PCIe 3.0)与 Xeon E5-2696 v4 处理器,将 48 层专家层置于主机内存,其余部分置于 GPU。 2. 性能调优:通过修复专家缓存 PR 中的 Bug、优化加载时间以及解决内存热节流问题,实现了显著的吞吐量增长。 3. 实践价值:该方案展示了在消费级硬件上运行大规模上下文(261k context)模型的工程可行性,并提供了可构建的优化分支供开发者参考。

获取每日 AI 情报与羊毛福利

加入 Telegram 频道 @ainews_Go,第一时间接收精选资讯推送。

立即加入

相关阅读