GoForum🌐 V2EX

2 台 DGX Spark 上运行的本地 LLM 横向对比

ldm0 · 2026-09-04 00:33 · 0 次点赞 · 2 条回复

有三个模型能跑

过去一周 flash 模型集体更新:

  1. Qwen3.8-Flash-Next
  2. GLM-5.3-FLash
  3. DeepSeek-V4-Flash-Vision-Exp(之前没有 Vision)

比较幸运的是这几个模型刚刚好都能在两台 DGX Spark 上面跑起来,直接爽吃。

横向比较

在这三个模型里面来回切换了好多次,说一下使用体验:

  • 速度层面:

Qwen3.8-Flash-Next > DeepSeek-V4-Flash-Vision-Exp > GLM-5.3-FLash

  • 代码质量:

GLM-5.3-FLash > DeepSeek-V4-Flash-Vision-Exp > Qwen3.8-Flash-Next

  • 图形理解:

GLM-5.3-FLash > Qwen3.8-Flash-Next > DeepSeek-V4-Flash-Vision-Exp

比较细节的是 GLM-5.3-FLash 有两个量化版本 EXL3 和 NVFP4:

  1. NVFP4 的 prefill 更快(加载历史会话更快) 1500t/s 左右,比 EXL3 1000t/s 快很多
  2. EXL3 的 decode 更快(吐字更快) 28t/s ,比 NVFP4 20t/s 快很多

主观结论

我主要是用 Hermes ,这三个模型其实都已经非常不错了,没有找到什么明显瑕疵。

总的来说如果要绝对质量,用 GLM-5.3-FLash; 要绝对速度,用 Qwen3.8-Flash-Next

DeepSeek V4 Flash 有点中不溜,而且图像理解似乎有点近视,看不清图片细节,实测被上面两个模型爆杀。

现在每天日常在用 Qwen3.8-Flash-Next :D

2 条回复
honjow · 2026-09-04 02:48
#1

羡慕双 DGX

ldm0 · 2026-09-04 04:28
#2

@honjow 几个月之前从闲鱼低价收的,现在的价格已经完全买不起了 T.T

添加回复
你还需要 登录 后发表回复

登录后可发帖和回复

登录 注册
主题信息
作者: ldm0
发布: 2026-09-04
点赞: 0
回复: 0