V2EX
V100 双卡运行 Qwen2.5-32B-GGUF 配置分享
分享在双卡 V100-SXM2-16GB(共 32GB 显存)环境下部署 Qwen 模型的实践方案。采用 UD-IQ4_XS 量化版本,配置 256k 长上下文、Q4 KV 缓存及 mmproj,实现在有限显存下对超长上下文的完整支持,满足日常编码与生产环境需求。实测在 4 并发下,prefill 速度达 300-400 tok/s,decode 速度为 30-60 tok/s。同时提供基于 Docker Compose 的 llama.cpp 完整部署参数,供低成本私有化部署大模型参考。
获取每日 AI 情报与羊毛福利
加入 Telegram 频道 @ainews_Go,第一时间接收精选资讯推送。