AiNews
⚡ 速览 🧠 模型
返回首页
V2EX

RTX PRO 5000 运行 Qwen3.8-27B-FP8 实践

在配备 48GB 显存的 RTX PRO 5000 上部署 Qwen3.8-27B-FP8 模型的实测记录。通过 sglang 启动服务,实测 prefill 速度超过 5000 token/s,decode 速度达到 60+ token/s。关键配置包含 flashinfer 注意力后端、fp8_e4m3 KV 缓存、EAGLE 投机解码,并启用了 qwen3 原生推理与工具调用解析器。这套参数组合兼顾了吞吐与延迟,为大内存工作站部署中等规模模型提供了可复用的调优参考。

获取每日 AI 情报与羊毛福利

加入 Telegram 频道 @ainews_Go,第一时间接收精选资讯推送。

立即加入

相关阅读