ldm0
V2EX  ›  Local LLM

2 台 DGX Spark 上运行的本地 LLM 横向对比

  •  
  •   ldm0 · 22h 16m ago · 2410 views

    有三个模型能跑

    过去一周 flash 模型集体更新:

    1. Qwen3.8-Flash-Next
    2. GLM-5.3-FLash
    3. DeepSeek-V4-Flash-Vision-Exp(之前没有 Vision)

    比较幸运的是这几个模型刚刚好都能在两台 DGX Spark 上面跑起来,直接爽吃。

    横向比较

    在这三个模型里面来回切换了好多次,说一下使用体验:

    • 速度层面:

    Qwen3.8-Flash-Next > DeepSeek-V4-Flash-Vision-Exp > GLM-5.3-FLash

    • 代码质量:

    GLM-5.3-FLash > DeepSeek-V4-Flash-Vision-Exp > Qwen3.8-Flash-Next

    • 图形理解:

    GLM-5.3-FLash > Qwen3.8-Flash-Next > DeepSeek-V4-Flash-Vision-Exp

    比较细节的是 GLM-5.3-FLash 有两个量化版本 EXL3 和 NVFP4:

    1. NVFP4 的 prefill 更快(加载历史会话更快) 1500t/s 左右,比 EXL3 1000t/s 快很多
    2. EXL3 的 decode 更快(吐字更快) 28t/s ,比 NVFP4 20t/s 快很多

    主观结论

    我主要是用 Hermes ,这三个模型其实都已经非常不错了,没有找到什么明显瑕疵。

    总的来说如果要绝对质量,用 GLM-5.3-FLash; 要绝对速度,用 Qwen3.8-Flash-Next

    DeepSeek V4 Flash 有点中不溜,而且图像理解似乎有点近视,看不清图片细节,实测被上面两个模型爆杀。

    现在每天日常在用 Qwen3.8-Flash-Next :D

    27 replies    2026-09-04 17:07:21 +08:00
    honjow
        1
    honjow  
       20h 4m ago   ❤️ 1
    羡慕双 DGX
    ldm0
        2
    ldm0  
    OP
       18h 22m ago
    @honjow 几个月之前从闲鱼低价收的,现在的价格已经完全买不起了 T.T
    witcherhope
        3
    witcherhope  
       14h 36m ago via iPhone
    羡慕大佬,不像我,只能用 4090 48G 版本本地跑一跑 Qwen3.8-27B-FP8
    zzutmebwd
        4
    zzutmebwd  
       14h 27m ago via Android
    hhh 看到最后一句果然是这样 其实本地模型就是够用够快,追求绝对智力直接换 opus api
    0x400
        5
    0x400  
       14h 22m ago via iPhone
    速度具体是多少呢
    heyjei
        6
    heyjei  
       13h 59m ago
    我也部署了一个 QWen3.8 27B ,速度有 30tokens/s

    不过我的问题是 claude code 接这个用的时候,始终无法流畅使用,不是 auto mode 的权限分类器无法成功运行,就是 Web Search 无法运行。

    你是怎么用你自己搭的本地 LLM ,前面有接什么 agentic api 层吗?
    qazwsxkevin
        7
    qazwsxkevin  
       13h 56m ago
    大佬可以说一下上面提到的 3 个模型的精度吗? 同一个模型精度差一个级别,输出质量有多大区别?
    sentinelK
        8
    sentinelK  
       13h 46m ago
    @heyjei 相对而言 dsh 这种比较开放的 harness 更方便实现全工具能力。可以靠插件,可以靠 skill 。
    Codex 和 Claude Code 都是依赖 API 来提供 web_search 的,所以一般只能安装第三方 MCP 来实现。

    @qazwsxkevin 抱脸的量化方在文档中都会着重体现自己的量化方案的损失,关键词是 KDL 以及 Top 1%正确率。通常来讲,优秀的 4bit 量化的 top 1%大概在 95%~97%。比如 unsloth 就以量化损失小著称。他们会公布热门产品的量化损失曲线。
    tsja
        9
    tsja  
       13h 36m ago
    小白想知道,像这样本地运行的都是量化版的吧,像 GLM5.3flash 的量化版和官方 API 的满血版性能体验差距有多大呢?
    RexKang
        10
    RexKang  
       12h 48m ago
    @ldm0 好奇多低收的……能说个范围吗
    qa2080639
        11
    qa2080639  
       11h 33m ago
    一台的话推荐什么模型 我部署的 qwen27B 才 25T/s
    ldm0
        12
    ldm0  
    OP
       11h 19m ago
    @zzutmebwd 快就是好.jpg
    主要是 Qwen 的智力其实也很高了,只要不写代码。
    ldm0
        13
    ldm0  
    OP
       11h 18m ago
    @0x400 qwen 和 deepseek 的 prefill 差不多是 2500t/s 和 1800t/s ,单流 decode 二者差不多都是 70t/s ,多流的话 qwen decode 要更快一些
    ldm0
        14
    ldm0  
    OP
       11h 15m ago
    @heyjei 换一个对本地 LLM 支持更好的 harness 吧,比如 pi 。
    ldm0
        15
    ldm0  
    OP
       11h 13m ago
    @qazwsxkevin DeepSeek 是 fp8 满血,GLM 是 EXL3 和 nvfp4 ,Qwen 是 nvfp4 。

    这几个量化都不极限,智力基本都保持的比较好,几个模型看评估数据基本都是 95%以上,我体感上没有智商问题。
    ldm0
        16
    ldm0  
    OP
       11h 12m ago
    @tsja 没有用过官方 API ,但是 GLM5.3 Flash EXL3/NVFP4 的能力其实已经远远超出我的预期了,聪明是真的聪明,和其它两个有代差的感觉。
    ldm0
        17
    ldm0  
    OP
       11h 11m ago
    @RexKang 5w4 收的两台+连接线
    ldm0
        18
    ldm0  
    OP
       11h 9m ago
    @qa2080639 一台可以用 Ling Flash 之类的模型,DeepSeek V4 Flash 也有一个单 DGX Spark 可跑单量化版本。

    可以去 nvidia 论坛看看,不少人都只有一台 https://forums.developer.nvidia.com/c/accelerated-computing/dgx-spark-gb10/719
    yachen
        19
    yachen  
       9h 52m ago
    双 dgx prefill 和 decode 实测多少速度?
    ldm0
        20
    ldm0  
    OP
       9h 2m ago
    @yachen 上面有说,不同模型差别挺大的。
    xqk111
        21
    xqk111  
       8h 52m ago
    这个部署的话,能几个人同时用吗
    minibear2021
        22
    minibear2021  
       8h 48m ago
    @ldm0 #17 性价比出来了
    ldm0
        23
    ldm0  
    OP
       8h 37m ago
    @xqk111 glm 5.3 不行,没有足够 kv cache ,deepseek 还有 qwen 可以。
    ldm0
        24
    ldm0  
    OP
       8h 37m ago
    @minibear2021 如果硬件正常贬值的话没什么性价比,但是现在还能小赚一点的话性价比就爆了。
    flyico
        25
    flyico  
       6h 50m ago
    无论什么时候,都是线上 plan 比本地划算啊,有这几个 w 够你买多少年的 plan ,而且永远是满血+最强+最新版,本地部署唯一的优点就是数据安全可控,对于合规要求高的只能有本地部署了
    TArysiyehua
        26
    TArysiyehua  
       6h 43m ago
    @flyico 也不能这么说,现在硬件出来没多久就涨价,买这个比买 A 股还香,自己 5 万买的玩了一年 10 万卖出去。
    ldm0
        27
    ldm0  
    OP
       5h 39m ago
    @flyico 可以全都要,比如现在线上 plan 会拒绝干一些逆向的活,然后一些敏感问题也可以问,全在本地就很安心。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2955 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 46ms · UTC 14:47 · PVG 22:47 · LAX 07:47 · JFK 10:47
    ♥ Do have faith in what you're doing.