AiNews
⚡ 速览 🧠 模型
← 返回首页

#gguf

包含标签 "gguf" 的文章,共 10 篇。

🛠️ 开发工具 Reddit

三进制模型GGUF的Base-3无损打包方案

针对BitNet-b1.58和Ternary-Bonsai等三进制大模型,社区推出了一种更紧凑的GGUF变体格式:Q2_B3(B3S)。由于三进制权重仅限于-1、0、1,传统Q2编码会造成空间浪费。B3S通过Base-3直接打包这三种状态,在128个权重的分块中,仅需26字节的打包数据外加1个f16缩放因子,每个块共28字节,折合每个权重1.75位。相比传统方案,该方法在保持无损的前提下,将权重显存占用降低了约22%,有效缓解了边缘端和本地推理的显存压力。

🛠️ 开发工具 Reddit

RTX 5090 运行 Qwen 27B 模型配置实测

围绕 RTX 5090 显卡与 128GB DDR4 内存环境,探讨使用 Llama.cpp 部署 Qwen 27B GGUF 模型的最佳参数。开发者分享了具体的 models.ini 配置,重点测试了 q5 等不同量化级别的显存占用与推理速度,评估了开启 flash-attn 的实际效果。针对代码编写场景,重点分析了在模型准确率与 256K 超长上下文窗口之间的平衡取舍,为在消费级高端硬件上运行中等规模开源模型提供了一套可参考的调优方案。

🛠️ 开发工具 V2EX

双 V100 跑 Qwen2.5-27B-GGUF 配置实测

在双卡 V100-SXM2-16GB(共 32G 显存)环境下,成功跑通 Qwen2.5-27B-GGUF 模型。实测推荐 UD-IQ4_XS 量化版本,搭配 256k 上下文、Q4 KV 缓存与 mmproj,在编码和生产场景中表现稳定。性能方面,prefill 速度在 300 至 400 tok/s 之间,decode 速度维持在 30 至 60 tok/s,支持默认 4 并发。通过基于 llama.cpp 的 Docker Compose 部署方案,为中端显卡运行中大型开源模型提供了一套可落地的优化参考。

🧠 模型动态 Hacker News

Axera AX8850 运行 GGUF 模型实践

在边缘端 AI 处理器 Axera AX8850 上运行 GGUF 格式大语言模型。通过对 GGUF 格式的支持,开发者可以在资源受限的嵌入式设备中高效加载与运行量化模型,降低边缘侧部署门槛。该实践展示了国产边缘 AI 硬件对主流开源模型生态的适配能力,为物联网设备的端侧大模型落地提供参考。

🛠️ 开发工具 V2EX

V100 双卡运行 Qwen2.5-32B-GGUF 配置分享

分享在双卡 V100-SXM2-16GB(共 32GB 显存)环境下部署 Qwen 模型的实践方案。采用 UD-IQ4_XS 量化版本,配置 256k 长上下文、Q4 KV 缓存及 mmproj,实现在有限显存下对超长上下文的完整支持,满足日常编码与生产环境需求。实测在 4 并发下,prefill 速度达 300-400 tok/s,decode 速度为 30-60 tok/s。同时提供基于 Docker Compose 的 llama.cpp 完整部署参数,供低成本私有化部署大模型参考。

🛠️ 开发工具 Reddit

开发者如何自定义与量化 GGUF 模型

探讨本地部署开源大模型时,开发者自定义与量化 GGUF 模型的核心实践。内容涵盖基于 Vulkan 或 ROCm 后端的 llama.cpp 编译优化、量化工具版本的选择要点,以及在量化过程中对特定层进行高精度保留的方法。为需要精细控制模型显存占用与推理性能的开发者提供技术参考。

🧠 模型动态 Reddit

16GB 显存本地跑大模型配置经验

围绕 16GB 显存设备本地运行大模型的社区实践展开。开发者们分享了具体的量化模型选择与参数调优经验,例如在 Windows 系统下跑 Qwen 27B 的无审查量化版本(IQ4-XS-MTP-16GB-VRAM-GGUF)。核心技巧包括:禁用 MTP、将部分矩阵投影(mmproj)卸载到 CPU 内存,以及合理控制上下文窗口在 90k 到 100k 之间,确保模型主体完整载入显存,在硬件限制下平衡显存占用与上下文长度。

🧠 模型动态 Reddit

Gemma 4 31B MTP草稿模型量化优化

双卡 RTX 3090 环境下的 Gemma 4 31B 实践。开发者将 MTP(多Token预测)草稿模型从 Unsloth 默认的 Q4_0 转为 Q4_K 格式。实测显示,解码速度从 65 TPs 提升到 72 TPs,性能提升约 10%。此外,更激进的 Q2_K 量化效果不佳。该方案为消费级双卡环境下的推理加速和草稿模型调优提供了可行参考。

🧠 模型动态 Reddit

剥离视觉模块:本地大模型显存优化探讨

在本地部署多模态大模型进行智能体编程(Agentic Coding)时,显存(VRAM)往往是核心瓶颈。Reddit 社区用户提出,通过在推理时剥离 GGUF 格式模型中的视觉投影文件(`mmproj`),可以显著降低显存占用,并询问这是否会损害模型的纯文本能力。 从技术原理来看,多模态模型由文本基座、视觉编码器及连接两者的投影器组成。在本地推理中,`mmproj` 负责图像特征的映射。 关键结论表明,剥离视觉模块对模型的纯文本和代码能力毫无影响。因为基座文本模型的权重保持完整,模型只是退化为了纯文本版本。 对开发者而言,在不需要视觉输入的场景(如纯代码生成)下,剥离视觉组件可以释放宝贵的显存,从而在有限硬件上运行更大参数的模型或拓展上下文窗口,显著提升本地 Agent 的运行效率。

🧠 模型动态 Reddit

Gemma-4 APEX量化实测:长上下文表现优异

近日,Reddit 社区用户分享了针对 Gemma-4 26B A4B 模型的 APEX 量化版本(APEX-I-Compact,约 15GB)的实测体验。在 16GB 显存的显卡上,通过 llama.cpp Vulkan 运行,该量化模型在高达 90,000 的超长上下文窗口下,依然跑出了 38 tps 的高速度,且未出现生成死循环或明显的质量退化。相比之下,此前使用的 Unsloth ud-q5kxl 量化版本(大小为 21.2GB)在 50,000 上下文时就会出现死循环。这一测试结果表明,APEX 量化技术在保持模型精度的同时,极大地优化了显存占用与长上下文处理能力。对于使用消费级显卡(如 16GB 显存)的本地大模型开发者而言,APEX 量化版 GGUF 模型提供了一个兼顾速度、容量与长文本稳定性的优秀选择。