V2EX
双 DGX Spark 本地模型实测对比
在两台 DGX Spark 环境下,对 Qwen3.8-Flash-Next、GLM-5.3-FLash 和 DeepSeek-V4-Flash-Vision-Exp 三款轻量模型进行了实测。推理速度上,Qwen3.8-Flash-Next 占优;代码生成与图文理解则是 GLM-5.3-FLash 表现更好。量化版本对比显示,GLM-5.3-FLash 的 NVFP4 版本在首字延迟和历史加载的 prefill 阶段更快,最高达 1500 tokens/s;而 EXL3 版本在解码吐字阶段更有优势,能到 28 tokens/s。整体来看,这几款模型在本地部署下均已具备出色的开发辅助能力,适合在高性能硬件集群上按需选用。
获取每日 AI 情报与羊毛福利
加入 Telegram 频道 @ainews_Go,第一时间接收精选资讯推送。