V2EX
双 V100 跑 Qwen2.5-27B-GGUF 配置实测
在双卡 V100-SXM2-16GB(共 32G 显存)环境下,成功跑通 Qwen2.5-27B-GGUF 模型。实测推荐 UD-IQ4_XS 量化版本,搭配 256k 上下文、Q4 KV 缓存与 mmproj,在编码和生产场景中表现稳定。性能方面,prefill 速度在 300 至 400 tok/s 之间,decode 速度维持在 30 至 60 tok/s,支持默认 4 并发。通过基于 llama.cpp 的 Docker Compose 部署方案,为中端显卡运行中大型开源模型提供了一套可落地的优化参考。
获取每日 AI 情报与羊毛福利
加入 Telegram 频道 @ainews_Go,第一时间接收精选资讯推送。