AMD MI100 跑 Qwen 27B INT8 推理优化方案
针对老旧的 4 卡 AMD MI100 硬件平台,有开发者实现了 Qwen27B INT8 的完整推理服务栈。该方案通过定制的 vLLM 分支、AITER、27B GPTQ INT8 量化以及 DFlash2 技术,将低精度推理深度整合到 Qwen 模型及相关依赖库中,并引入了新型融合内核。在总成本约 6500 美元的硬件配置下,该系统实现了 972 TG(生成吞吐)与 5680 PP(提示词吞吐)的性能表现。这为旧款算力设备运行大语言模型提供了一条高性价比的优化路径,有效解决了老旧硬件因数据类型受限而导致主流 AI 服务性能不佳的问题。