RTX PRO 5000 运行 Qwen3.8-27B-FP8 实践
在配备 48GB 显存的 RTX PRO 5000 上部署 Qwen3.8-27B-FP8 模型的实测记录。通过 sglang 启动服务,实测 prefill 速度超过 5000 token/s,decode 速度达到 60+ token/s。关键配置包含 flashinfer 注意力后端、fp8_e4m3 KV 缓存、EAGLE 投机解码,并启用了 qwen3 原生推理与工具调用解析器。这套参数组合兼顾了吞吐与延迟,为大内存工作站部署中等规模模型提供了可复用的调优参考。