AiNews
⚡ 速览 🧠 模型
← 返回首页

#quantization

包含标签 "quantization" 的文章,共 30 篇。

🧠 模型动态 Reddit

Qwen3.8 Flash Next 在 128GB Strix Halo 上的量化适配实践

在 128GB Strix Halo 平台上部署 Qwen3.8-Flash-Next-UD-Q5_K_XL 模型时,当同时跑语音识别、智能助手和语音合成等多模态服务,内存会直接压到极限。实测数据显示,mmproj 占用约 1GB;MTP 实际吃掉 5.5GB 内存,而其文件本身只有 2.8GB。此外,上下文长度和 KV 缓存量化对整体系统资源的消耗也十分明显。这些真实跑出来的内存数据,能为在消费级高性能硬件上部署多模态大模型的开发者提供直接的资源规划参考。

💻 AI 编程 Reddit

Ninfer 结合 YaRN 实现 400k 上下文实践

开源社区近期在本地大模型优化上有了新进展,开发者通过将 YaRN 上下文扩展技术与 Ninfer 框架结合,成功实现了 400k 超长上下文支持。该方案集成了 nvfp4 KV 缓存量化、dflash2 支持,并修复了 Qwen 的工具调用问题。在实际的“大海捞针”测试和多轮编码会话中,这套组合拳表现稳定。对于需要在本地部署大容量上下文、提升长文本处理和代码辅助能力的开发者来说,这套方案具备很高的实用参考价值。

🧠 模型动态 Reddit

在 CPU 上高效运行 Qwen3.5 0.8B 的工程实践

为了在 GPU 满载时分担语音听写文本的清理工作,开发者尝试将 Qwen3.5 0.8B 部署到本地 CPU 环境。项目借助 Codex 编写了一个专用的 C++ 推理引擎,并设计了名为 H128/Q4-G32-DOT4 的自定义 4 比特量化方案。该方案结合了基于激活值的校准与块级误差补偿技术,在将模型体积压缩至 425 MB 的同时,保持了极佳的推理性能,充分展现了微型开源模型在边缘和本地 CPU 上的实用价值。

🧠 模型动态 Reddit

开发者发帖求测 Qwen 量化版性能

Reddit 上有开发者发帖求助,希望社区成员对 Unsloth 优化的 Qwen 27B Q8 和 Q4 两个量化版本进行基准测试。发帖人因纠结 Flash 版本的实际表现而难以抉择,希望能有具体的性能对比数据。这反映出开发者在实际部署开源大模型时,对不同量化方案在显存占用与推理速度之间的权衡高度关注。

🛠️ 开发工具 Reddit

三进制模型GGUF的Base-3无损打包方案

针对BitNet-b1.58和Ternary-Bonsai等三进制大模型,社区推出了一种更紧凑的GGUF变体格式:Q2_B3(B3S)。由于三进制权重仅限于-1、0、1,传统Q2编码会造成空间浪费。B3S通过Base-3直接打包这三种状态,在128个权重的分块中,仅需26字节的打包数据外加1个f16缩放因子,每个块共28字节,折合每个权重1.75位。相比传统方案,该方法在保持无损的前提下,将权重显存占用降低了约22%,有效缓解了边缘端和本地推理的显存压力。

🧠 模型动态 Reddit

AtomicChat 模型量化遭质疑:标称混合精度实为极低比特

Reddit 社区用户对 AtomicChat 提供的 Qwen3.8-Flash-Next 模型量化版本提出质疑。开发者分析发现,该版本移除 ngram 表后的文件体积仅为 56GB 左右,异常偏小。进一步检查显示,其内部多数张量实际采用的是 IQ2_S 格式,而非宣传中的 Q4_K、Q5_K 或 Q6_K 等常规混合精度。这一情况引发了开发者对社区中“该版本表现优秀且兼容性好”这一说法的重新评估,也暴露出模型量化过程中透明度不足的问题。

🧠 模型动态 Reddit

RTX 5090 与 3090 运行 Qwen3.8-Flash-Next 实测

在 RTX 5090 与 RTX 3090 双卡异构环境下,成功部署 Qwen3.8-Flash-Next(125B MoE 架构,6B 激活参数,48层)。实验采用 unsloth UD-Q4_K_XL GGUF 量化版本,模型体积约 111 GB。通过基于 llama.cpp 分支构建的服务端,修复了图节点预算、量化 KV 缓存及回滚支持等兼容性问题。最终在双卡环境下跑出了约 30 token/s 的推理速度,为在消费级硬件上部署大规模 MoE 模型提供了可行的性能参考。

🧠 模型动态 Reddit

Qwen 3.8 27B 量化版与 Claude Opus 4.6 性能实测

在 RTX 6000 工作站上,对社区量化版 Qwen 3.8 27B 与 Claude Opus 4.6 的实际表现进行了对比。测试重点关注本地开源量化模型与闭源商业模型在推理速度、显存占用以及特定任务输出质量上的差距。对于注重成本控制和本地部署的开发者来说,这次实测展示了中等规模开源模型在专业硬件上的性价比,为评估本地量化方案的应用可行性提供了直接参考。

🛠️ 开发工具 Reddit

AMD MI100 跑 Qwen 27B INT8 推理优化方案

针对老旧的 4 卡 AMD MI100 硬件平台,有开发者实现了 Qwen27B INT8 的完整推理服务栈。该方案通过定制的 vLLM 分支、AITER、27B GPTQ INT8 量化以及 DFlash2 技术,将低精度推理深度整合到 Qwen 模型及相关依赖库中,并引入了新型融合内核。在总成本约 6500 美元的硬件配置下,该系统实现了 972 TG(生成吞吐)与 5680 PP(提示词吞吐)的性能表现。这为旧款算力设备运行大语言模型提供了一条高性价比的优化路径,有效解决了老旧硬件因数据类型受限而导致主流 AI 服务性能不佳的问题。

🧠 模型动态 Reddit

量化感知修复技术:4bit模型超越全精度原版

量化感知修复(Quantization-Aware Healing)技术,该方法通过特定的压缩与修复流程,成功让一个 4-bit 量化后的模型在性能上超越了其全精度(Full-Precision)原始版本。在本地大模型部署与资源优化的背景下,量化通常会导致一定的精度损失,而这项技术为缓解精度衰减提供了新的解决思路。通过在量化过程中进行针对性的补偿与微调,不仅有效压缩了模型体积、降低了显存占用与推理成本,还意外提升了模型在某些任务上的表现。这对于希望在消费级硬件或边缘设备上运行高效、高精度模型的中国开发者和 AI 从行者具有重要的实践参考价值,展示了模型压缩技术的新潜力。

🧠 模型动态 Reddit

独立开发者从零训练2.5亿参数量化模型

一名开发者分享了从头训练2.5亿参数大模型的实践过程。该模型基于300B规模的FineWeb数据集完成训练,并通过低于2位的量化技术,将模型部署包体积压缩至60MB,运行时内存占用仅约80MB。这一实践验证了在消费级或资源受限环境下定制训练轻量级模型的可行性,为边缘端部署提供了实用的参考方案。

🧠 模型动态 Reddit

开发者从零训练2.5亿参数量化大模型

开发者基于 FineWeb 数据集的 30B token,从零训练了一个 2.5 亿参数的大语言模型。通过低于 2-bit 的量化技术,模型部署包体积压减至 60 MB 以内,运行时内存占用约 80 MB,在普通笔记本 CPU 上不依赖 GPU 即可实现约 400 tok/s 的推理速度。在长文本处理上,该模型采用分层架构:最近 2048 个 token 维持常规 fp16 的 KV cache,早期历史数据则压缩至 1-bit 并持久化到磁盘(约 320 字节/token),令 100 万 token 的上下文历史仅需约 320 MB 磁盘空间,验证了小型量化模型在边缘端与长文本场景的落地潜力。

🛠️ 开发工具 Reddit

开发者如何自定义与量化 GGUF 模型

探讨本地部署开源大模型时,开发者自定义与量化 GGUF 模型的核心实践。内容涵盖基于 Vulkan 或 ROCm 后端的 llama.cpp 编译优化、量化工具版本的选择要点,以及在量化过程中对特定层进行高精度保留的方法。为需要精细控制模型显存占用与推理性能的开发者提供技术参考。

🧠 模型动态 Reddit

Qwen3.8-27B Q6 模型编程智能体实测表现亮眼

Reddit 社区讨论显示,Qwen3.8-27B 的 Q6 量化版本在编程智能体任务中表现突出。开发者在本地实际开发流中测试发现,该模型在代码生成、多步骤逻辑推理和复杂任务自主执行上具备明显优势。这一性能为国内开发者和 AI 创业者提供了低成本、高性能的中型本地部署选择,有效降低了软件开发自动化的落地门槛。

🧠 模型动态 Reddit

16GB 显存本地跑大模型配置经验

围绕 16GB 显存设备本地运行大模型的社区实践展开。开发者们分享了具体的量化模型选择与参数调优经验,例如在 Windows 系统下跑 Qwen 27B 的无审查量化版本(IQ4-XS-MTP-16GB-VRAM-GGUF)。核心技巧包括:禁用 MTP、将部分矩阵投影(mmproj)卸载到 CPU 内存,以及合理控制上下文窗口在 90k 到 100k 之间,确保模型主体完整载入显存,在硬件限制下平衡显存占用与上下文长度。

💻 AI 编程 V2EX

本地 Qwen2.5-32B 与 Deepseek 编程实测对比

来自 V2EX 社区的开发者分享了本地部署 Qwen 模型与 Deepseek 在前端编程任务中的实测表现。测试以“生成骑自行车的鹈鹕 SVG 动画”为统一任务,横向对比了不同量化版本(Q5_K_M、Q4_K_M)与 Deepseek 网页版及 API 的实际效果。数据涵盖了生成耗时、交互轮数、输出速度、Token 吞吐量以及硬件运行成本。这组实测数据为国内开发者在硬件受限或追求性价比时,如何权衡本地开源模型与云端商业模型的编程效能,提供了有价值的参考基准。

💻 AI 编程 Reddit

llama.cpp 通过 AVX2 优化大批量提示词处理

开发者 bartowski1182 在 llama.cpp 提交了新的 Pull Request,利用 AVX2 指令集大幅提升了 IQ 量化模型在大批量提示词处理阶段的运行速度。该优化主要面向没有高级硬件加速的消费级 CPU 环境,通过改进矩阵运算和数据加载路径,有效缓解了大规模推理时的性能瓶颈。对于本地部署量化模型的开发者来说,这项改进能在不增加硬件成本的情况下,明显改善吞吐量和处理延迟,提升本地 AI 应用的运行效率。

🧠 模型动态 Reddit

LFM2.5-2.6B 模型与 KV 缓存量化评测

Liquid AI 推出的 LFM2.5-2.6B 模型在轻量化架构中备受关注。本测试针对该模型的权重及 KV 缓存展开不同精度的量化验证,重点考察显存占用、推理吞吐量与生成质量之间的平衡。测试数据表明,合理的量化方案能在几乎不损失模型能力的前提下,显著降低本地部署和边缘端设备的硬件门槛,为资源受限场景下的模型落地提供直接的性能参考。

🧠 模型动态 Reddit

Gemma 4 31B MTP草稿模型量化优化

双卡 RTX 3090 环境下的 Gemma 4 31B 实践。开发者将 MTP(多Token预测)草稿模型从 Unsloth 默认的 Q4_0 转为 Q4_K 格式。实测显示,解码速度从 65 TPs 提升到 72 TPs,性能提升约 10%。此外,更激进的 Q2_K 量化效果不佳。该方案为消费级双卡环境下的推理加速和草稿模型调优提供了可行参考。

🧠 模型动态 Reddit

Ling-3.0-flash MXFP4 本地运行实测

Ling-3.0-flash MXFP4 版本已完成发布,并在单台 DGX Spark 设备上跑通本地部署。这次实践验证了该模型在特定硬件上的运行效率,为开发者在边缘端和本地工作站部署大语言模型提供了可参考的落地案例,同时也为模型量化方案的实际应用推进了一步。

🧠 模型动态 Reddit

Laguna S 2.1 推出 FP8 与 NVFP4 官方量化权重

Laguna S 2.1 模型现已上线 FP8 与 NVFP4 官方权重。此次更新为开发者提供了更多样的量化方案,能有效压减 NVIDIA GPU 上的显存占用并提升推理吞吐量。新权重的发布进一步降低了高性能模型的本地部署门槛,便于在保障精度的同时控制硬件成本,适合在边缘计算与本地推理场景中落地应用。

🧠 模型动态 Reddit

DeepSeek V4 Flash 0731 本地量化性能实测

在消费级硬件上对 DeepSeek V4 Flash 0731 进行了本地量化基准测试。测试环境为双卡 RTX 3060 搭配 96GB 内存,模型选用 IQ2_M 量化版本。实测显示,该配置下的推理速度约为 3.5 tok/s。这一数据反映了在非企业级设备上运行更大规模量化模型的实际表现与当前的性能瓶颈,可供开发者在本地部署时参考。

🧠 模型动态 Reddit

DGX Spark与Qwen 3.5模型选型实录

在DGX Spark等硬件上部署大模型时,开发者正面临复杂的量化方案与选型权衡。近期讨论热点涵盖多个主流及量化版本,如采用NVFP4量化的Laguna 2.1、Q2量化的DeepSeek V4,以及IQ3量化的Inkling-Small。同时,社区对Ling 3.0 124B和LongCat 69B A3B等新模型保持高度关注。这些实践反映出本地部署在硬件算力、推理性能与量化精度之间取舍的常态,也为后续的基准测试提供了真实的参考基准。

🧠 模型动态 Hacker News

8美元微控制器运行28.9M参数LLM

这篇文章揭示了在仅需8美元的ESP32-S3微控制器上成功运行一个28.9M参数大型语言模型(LLM)的突破性进展。这一成就标志着边缘AI领域的一个重要里程碑,特别是在成本和功耗受限的应用场景中。 核心技术在于对Llama 2 7B模型进行了极致的量化,将其参数量压缩至每参数2.7比特,最终形成一个28.9M参数的模型。这个高度优化的模型能够适配ESP32-S3有限的16MB PSRAM和512KB SRAM。尽管运行速度相对较慢,但这一实现有力地证明了在超低成本硬件上部署复杂AI模型的可行性。 对于中国开发者和AI创业者而言,这一进展具有深远影响。它为物联网设备、智能家居、工业控制等领域开辟了新的应用前景,意味着这些设备未来可能直接在本地进行复杂的语言理解和生成任务,而无需依赖云端。这不仅能降低AI部署成本,还能加速AI的普惠化进程,鼓励开发者探索更多创新的边缘AI应用场景。同时,它也强调了模型压缩技术(如量化)和高效推理框架在推动AI普及中的关键作用,为开发低成本、低功耗的智能硬件产品提供了新的思路和技术路径。

💻 AI 编程 Hacker News

Mac M2 16GB 本地AI预算管理与优化

在Mac M2 16GB这类资源受限的本地环境中运行AI模型,是许多开发者面临的挑战。本文深入探讨了如何在有限的硬件预算下高效管理和优化本地AI应用。主要背景是,随着大模型和AI工具的普及,开发者希望在本地进行实验和开发,以节省云服务成本并保护数据隐私,但消费级硬件的内存和计算能力往往成为瓶颈。 文章详细介绍了多项核心技术实现和策略。首先,强调了模型选择的重要性,推荐使用经过量化(如4-bit或8-bit GGUF格式)的小型语言模型(LLM)或针对边缘设备优化的视觉模型。其次,阐述了如何利用llama.cpp、Ollama、MLC LLM等专为本地推理优化的框架,这些工具能有效利用Apple Silicon芯片的GPU和神经引擎(ANE)进行加速。在内存管理方面,文章提供了具体建议,例如通过分层加载(layer offloading)将部分模型层卸载到CPU以节省GPU内存,以及优化批处理大小和数据加载策略。 关键结论和对开发者的实际影响在于,即使在16GB内存的Mac M2上,通过精心的模型选择、工具链优化和资源管理,开发者也能成功运行并开发具有实际价值的AI应用,例如代码辅助、文本摘要或本地图像处理。这不仅降低了对昂贵云API的依赖,提升了开发效率,也为AI创业者在本地化AI解决方案上提供了宝贵的实践指导。文章旨在赋能开发者,使其能在有限资源下最大化本地AI的潜力。

💻 AI 编程 Reddit

纯Rust 1比特LLM引擎:边缘CPU高性能低内存

近期,学术界对1比特量化、BitNet (1.58b) 等技术展开了热烈讨论,旨在将大型语言模型(LLMs)的性能推向极致。本文作者致力于将这些前沿理论从白皮书阶段转化为实际可用的生产级解决方案。 作者采取了创新的技术路径,完全绕开了PyTorch、`llama.cpp`、BLAS和CUDA等传统深度学习框架及库。他从零开始,使用纯Rust语言编写了一个自定义的、零依赖的推理引擎。该引擎能够直接在边缘CPU上运行原生的1比特和三元(ternary)打包模型,旨在实现极致的效率和资源占用。 通过这种纯Rust的原生实现,该引擎在边缘CPU上取得了显著的性能突破:实现了超过150个令牌每秒(TPS)的推理速度,并且内存占用仅为350MB。这一成果对于中国开发者和AI创业者具有重要意义,它表明即使在资源受限的边缘设备上,也能部署高性能、低功耗的LLM应用。 这为开发智能物联网设备、嵌入式AI系统以及其他需要本地化、实时推理能力的场景提供了新的可能性。同时,该项目也展示了Rust语言在构建高性能、系统级AI基础设施方面的巨大潜力,挑战了传统AI开发对Python生态和GPU加速的过度依赖,为AI模型在更广泛硬件环境下的部署开辟了新路径。

🧠 模型动态 Reddit

KVarN:方差归一化KV缓存量化

KVarN是一种新颖的KV缓存量化方法,旨在大幅提升大型语言模型在推理阶段的效率。该技术的核心在于结合了Hadamard旋转与对K和V矩阵双轴的方差归一化处理,随后进行四舍五入量化。这种方法虽然实现简单,但在实际应用中表现出色。 KVarN特别适用于解码密集型、测试时扩展(test-time-scaling)场景,例如复杂的推理任务、代码生成以及AI Agent应用。在这些场景下,KV缓存的内存占用和访问速度是关键瓶颈。通过KVarN,开发者可以实现3到4倍的KV缓存压缩,同时在AIME24等严苛基准测试中,模型准确率几乎没有下降,通常仅有0-1%的损失。 这项技术不仅显著减少了KV缓存的内存消耗,还带来了推理速度的提升,优于现有量化方法。对于追求高效部署大型模型、支持更长上下文窗口以及优化AI Agent性能的中国开发者和AI创业者而言,KVarN提供了一个极具价值的解决方案,有助于降低运营成本并加速应用迭代。

🧠 模型动态 Reddit

昇腾原生1.58-Bit大模型训练框架

本文介绍了由 OpenBMB 团队推出的 BitCPM-CANN,这是首个在华为昇腾(Ascend)NPU 平台上实现原生 1.58-Bit(三值化)量化感知训练(QAT)的系统性研究。针对极端低比特大模型在端侧部署时能否在复杂推理任务中保持性能的痛点,该研究填补了理论与实际硬件部署之间的空白。BitCPM-CANN 深入探索了三值化权重在端侧尺度下的能力保留问题,并通过昇腾 CANN 架构进行了深度优化,实现了高效的原生训练与推理。这一成果不仅证明了 1.58-Bit 大模型在复杂任务上的可行性,也为中国开发者在国产算力平台上部署超低功耗、高吞吐量的端侧大模型提供了极具价值的实践路径与技术参考。

🧠 模型动态 Reddit

Gemma-4 APEX量化实测:长上下文表现优异

近日,Reddit 社区用户分享了针对 Gemma-4 26B A4B 模型的 APEX 量化版本(APEX-I-Compact,约 15GB)的实测体验。在 16GB 显存的显卡上,通过 llama.cpp Vulkan 运行,该量化模型在高达 90,000 的超长上下文窗口下,依然跑出了 38 tps 的高速度,且未出现生成死循环或明显的质量退化。相比之下,此前使用的 Unsloth ud-q5kxl 量化版本(大小为 21.2GB)在 50,000 上下文时就会出现死循环。这一测试结果表明,APEX 量化技术在保持模型精度的同时,极大地优化了显存占用与长上下文处理能力。对于使用消费级显卡(如 16GB 显存)的本地大模型开发者而言,APEX 量化版 GGUF 模型提供了一个兼顾速度、容量与长文本稳定性的优秀选择。

🧠 模型动态 Reddit

4张2080Ti本地运行DeepSeek-V4

开发者分享了低成本本地运行DeepSeek-V4-Flash(284B参数)的方案。仅需不到2500美元,利用4张旧款RTX 2080 Ti显卡,通过定制Turing内核与W8A8量化,实现了255 tokens/s的Prefill速度。该实践证明了无需昂贵的新一代GPU,利用旧硬件和深度优化也能高效运行前沿MoE模型,极具实用价值。