Reddit
Qwen3.8-27B 在 RTX 3090 上的推理优化实测
开发者在单张 RTX 3090 显卡上对 Qwen3.8-27B 模型进行了推理性能优化。在解码速度达标后,优化重点转向了预填充阶段。通过引入自定义内核,在保持与 FP32 相当精度的前提下,4K 上下文下的预填充速度提升至每秒近 2,000 token,解码速度稳定在每秒 132 token。这表明消费级硬件完全有能力高效运行中等规模模型,为本地部署提供了切实可行的性能参考。
获取每日 AI 情报与羊毛福利
加入 Telegram 频道 @ainews_Go,第一时间接收精选资讯推送。