V2EX
三款 Flash 本地大模型在 DGX Spark 上的实测对比
在两台 DGX Spark 环境下,对 Qwen3.8-Flash-Next、GLM-5.3-FLash 与 DeepSeek-V4-Flash-Vision-Exp 三款轻量模型进行了横向评测。实测表明,Qwen3.8-Flash-Next 运行速度最快,DeepSeek 居中,GLM 稍慢。但在代码生成和图文理解上,GLM-5.3-FLash 的综合表现更优。同时测试了 GLM 的不同量化版本:NVFP4 的 prefill 加载速度可达 1500 tokens/s,EXL3 的 decode 吐字速度达到 28 tokens/s。这些数据可为开发者在本地硬件集群上部署轻量化大模型提供参考。
获取每日 AI 情报与羊毛福利
加入 Telegram 频道 @ainews_Go,第一时间接收精选资讯推送。