sentinelK
V2EX  ›  Local LLM

mac m5 ultra 上线中国官网。1.2T 显存带宽, 256GB 版本 8.6 万

  •  
  •   sentinelK · 10h 5m ago · 3635 views
    编者注:此文完全是数字推演,不代表真实硬件能力。笔者不对信息准确度负责。
    信源会罗列在文章下方
    

    结合 256GB 统一内存来看,目前比较有价值的就是运行 ds-v4-flash-0731 ,恰巧最近 omlx 有过一次版本更新,官方性能数据如下:信息来源 f917c000-707f-43a1-b0a1-23bd464ed4e9-image.jpeg

    然后,M5 Ultra 的内存带宽是 M3 Ultra 的接近 1.5 倍。又根据苹果官网数据,其 prefill 性能是 M3 Ultra 的 4 倍( ollama 数据,框架不同,只能参考)

    所以大概预期,M5 Ultra 运行 ds-v4-flash-0731 Q4 的大致性能是:

    prefill

    上下文 M3U ( v0.5.4rc2 )
    1K 531.0 ~1590 ~2120
    4K 486.5 ~1460 ~1950
    64K 468.5 ~1410 ~1870
    128K 438.6 ~1320 ~1750

    decode

    场景 M3 Ultra M5 Ultra 预计
    MTP 关,1K 27.6 ~40
    MTP 关,4K 25.8 ~38
    MTP 关,64K 22.8 ~33
    MTP 关,128K 21.3 ~31

    信息来源: https://newreleases.io/project/github/jundot/omlx/release/v0.5.4rc2

    https://www.apple.com.cn/mac-studio/

    https://omlx.ai/compare

    25 replies    2026-08-26 17:02:02 +08:00
    sentinelK
        1
    sentinelK  
    OP
       10h 1m ago
    也就是说,结合实际场景,大概实际应用时打开 MTP ,prefill 也就是 1500 左右的水平,decode 大概在 60 左右。

    prefill 性能仍然偏低。

    但是结合非常大的统一内存,能实现非常高的多会话缓存命中能力,所以和多卡部署相比,有利有弊。
    FrankAdler
        2
    FrankAdler  
       9h 39m ago via Android
    NVIDIA 打下的江山,Apple 开始摘桃子了吗
    ReinXD
        3
    ReinXD  
       9h 35m ago
    这个价格对比 n 卡服务器,甚至可以说性价比爆表,统一内存的架构优势在 LLM 时代凸显出来了
    xiaoyi123
        4
    xiaoyi123  
       9h 21m ago
    虽然比不上 nvidia ,但是便宜啊!!!!!
    octocatami
        5
    octocatami  
       9h 21m ago
    快囤 mac mini
    ila
        6
    ila  
       8h 53m ago
    可以使用 DeepSeek V4 Flash Vision Exp 吗
    Cruzz
        7
    Cruzz  
       8h 50m ago
    逼的哪天老黄给显卡加内存条。让你们胡搞
    scegg
        8
    scegg  
       8h 50m ago
    这速度适合一个人玩玩。甚至不适合一个人干活(并发 agent 的情况)。
    Nzelites
        9
    Nzelites  
       8h 26m ago
    dsf 什么时候个人部署可以比较简单的到 100tps 的话感觉比较可用
    sillydaddy
        10
    sillydaddy  
       8h 24m ago
    是不是比双 DGX Spark 要强?
    sentinelK
        11
    sentinelK  
    OP
       8h 21m ago
    @sillydaddy 从推论来讲,是。但是这个需要看实测。
    毕竟 GB10 跑的是 cuda ,mlx 环境不能直接横比。
    clemente
        12
    clemente  
       6h 47m ago
    @ReinXD 同配置 nv spark 只要 3w 啊
    OnEvent
        13
    OnEvent  
       5h 23m ago via iPhone
    这玩意是不是还能多机并联增加性能来着
    ReinXD
        14
    ReinXD  
       4h 22m ago
    @clemente dgx spark 显存没有 512g ,这个区别挺大的,跨越到 512g 意味着可以部署满血 1M 版本的 dpsk v4f ,而且 m5 ultra 带宽 1.2TB/s 也是吊打 dgx ,大模型计算核心耗时其实都是权重搬运,这个对实际使用提升应该是非常巨大的。总的来说,和 dgx 完全不是同级别的硬件,dgx spark 还是有点不上不下,m5 ultra 已经摸到云端服务器水平了,考虑到个人/小团队使用甚至非常超模,部署的好很有可能比用官方 api 的体验还舒服
    flyico
        15
    flyico  
       4h 13m ago
    Q4 量化版,和满血版能相差多大?
    dragonszy
        16
    dragonszy  
       4h 1m ago
    是不是得等 512gb 的版本
    mkdirmushroom
        17
    mkdirmushroom  
       3h 51m ago
    目前准备搞个 256 的,up 建议等 512 吗?个人感觉模型参数量大的话,受制于内存带宽,性能不会好到哪里去,所以感觉 512 的意义不是很大,相较于 256 的话。
    ReinXD
        18
    ReinXD  
       3h 40m ago   ❤️ 1
    @mkdirmushroom 真要买得等 512g ,能满血部署 1M dpsk v4f 是质变,不然不如买块 5090 玩,1.2T/s 对 1-4 个人来说其实是很超模的带宽水平,你对比 H200 那种 4.5T/s ,这么点人数根本吃不满带宽,楼主的估计其实还保守了点,低负载下+dspark mtp 加速,我算了下理论上至少能到 100 token/s
    unifier
        19
    unifier  
       3h 36m ago
    @dragonszy 跑 dsv4f 应该用不到 512 的,glm 的量化版本应该至少要 512 了
    sentinelK
        20
    sentinelK  
    OP
       3h 36m ago
    @dragonszy @mkdirmushroom 如果只是聚焦于 0731 的话,个人谨慎预测,性价比很低。
    v4-flash 无损就是 8bit ,所以其实 256GB 已经可以跑无损(和 GB10 * 2 逻辑一样),但是 prefill 和 decode 会更难看。

    而且家用不太可能同时占用太多个 session 的 kvcache 。同时保持 3~5 个 session 是在线的我已经觉得大脑过载了。

    512GB 的优势一个是能同时保持更多的 1M 上下文的 session 在线(能命中缓存)以外,就是能跑更大规模的模型。
    但是反过来说,更大规模的模型 prefill 和 decode 会更慢。

    所以,统一内存方案的掣肘就在这,看似能跑很大的模型,但是实际把 RAM 占满速度又无法接受。
    aimuz
        21
    aimuz  
       3h 33m ago
    256G 的要 14 万,512G 应该不会少于 20 万吧?
    tanszhe
        22
    tanszhe  
       3h 24m ago
    话说最近小米发布的 o100 也是 1.2T 带宽 是不是类似?
    sentinelK
        23
    sentinelK  
    OP
       3h 21m ago
    @tanszhe 这个完全没有基础数据,所以只能看看了。毕竟内存带宽只是一个必要条件,并不是充分条件。
    LLM 的表现和硬件、生态、框架、甚至模型本身都息息相关。

    就像是保时捷 911 卡雷拉的前悬挂用的依然是麦弗逊结构。但你不能说用多连杆的面包车比他更运动。
    slowgen
        24
    slowgen  
    PRO
       3h 11m ago
    今晚 Qwen3.8-Flash-Next 发布,和 Ling-3.0-Flash 差不多大小,125B A6B ,如果性能追上 DeepSeek v4 Flash 0731 的话,其实 256GB 就够。

    人的欲望总是随着新模型的发布不断上涨,买 512GB 赌的是未来这个容量可以跑下更大更 SOTA 的开源模型,赌 Fable 5 级别的模型很快就可以跑在个人设备上。
    sosme
        25
    sosme  
       2h 49m ago
    @tanszhe 小米那个应该和老黄那个 nv spark 差不多,统一内存撑死 128g
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3233 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 57ms · UTC 11:51 · PVG 19:51 · LAX 04:51 · JFK 07:51
    ♥ Do have faith in what you're doing.