Need4more
V2EX  ›  Local LLM

mac 本地部署 llm 不是最佳选择

  •  
  •   Need4more · Aug 31 · 4934 views

    有人说 AI 时代苹果是最大赢家,核心在于 mac 的成本优势,我不赞成。

    在成本方面,按照我个人的使用经验,调用云端 api (我们假设使用的是 deepseek v4 flash)每日成本在¥25/天,如果购买 M5 Max 128GB (市场价 4w )的话,回本周期为 4.4 年,超过电子产品的 3 年折旧期。

    抛开价格,我更在意速度和质量,日常使用体验直接和这两个挂钩,这块 api 明显占优,本地大模型量化后慢吞吞的、质量差要返工。唯一的优势就是隐私了,但是个人使用不在意这个。

    毫无悬念,最佳选择是用 API ,买机器是负投资。

    69 replies    2026-09-01 16:50:16 +08:00
    sentinelK
        1
    sentinelK  
       23h 55m ago   ❤️ 3
    其实这个逻辑很简单。
    如果只算经济账,自部署 LLM 性价比就能超过云厂商,那云厂商为何不用这款设备?

    自部署本质上就是一种反效率的个性化需求。即便如今 sglang 把 Qwen3.8-27B 的 prefill 性能和缓存巡回概率拉高到了和 API 接近的程度,且 flash-0731 涨价 5~6 倍的前提下,如果只算经济账,依然是不划算的。

    如果按照回本率来看,目前 5 系 N 卡+SGLang+Qwen3.8-27B 这套组合,应该是最接近同模型云厂商的。
    不光是 SGLang 的优化够强,还包含 Qwen3.8-27B 的云服务价格够贵。
    lynn1su
        2
    lynn1su  
       23h 40m ago
    mac 没法做到 1m 上下文把? api 是可以的
    Need4more
        3
    Need4more  
    OP
       23h 39m ago
    @lynn1su 我说了,在速度和质量这块,本地大模型零优势
    aimuz
        4
    aimuz  
       23h 34m ago
    M5 Max 128GB 能部署 flash-0731 满血版吗
    aimuz
        5
    aimuz  
       23h 34m ago
    M5 Max 128GB 五年后残值还能值 1 万 吧
    Need4more
        6
    Need4more  
    OP
       23h 32m ago
    @aimuz 明显不能,这个配置只能跑一些量化版本的,刚入门,不是最顶级的
    kevan
        7
    kevan  
       23h 31m ago
    如果只算经济账,自部署 LLM 性价比就能超过云厂商,那云厂商为何不用这款设备?

    +1, 卖的没有买的精吗?
    x1aoYao
        8
    x1aoYao  
       23h 31m ago
    你只考虑经济,不考虑审查/保密这些特殊需求,那确实没必要本地部署
    lesismal
        9
    lesismal  
       23h 21m ago
    1. 99%自部署的人都懂 OP 说的
    2. OP 不知道自部署的人的需求
    sagnitude
        10
    sagnitude  
       23h 14m ago   ❤️ 5
    @lesismal 事实上 99%集中发 mac 可以部署本地模型 的推荐和介绍帖子都不会提保密之类的真实需求,都会加上“买了就 token 自由”这种说明
    lesismal
        11
    lesismal  
       23h 10m ago
    @sagnitude 价格本身就是一道拦路虎,买之前没几个不计算、对比清楚的,这种简单的计算和对比对于要搞本地部署的人来讲根本没什么难度。

    只有极少的人不懂却买了,比如一些小老板,跟着概念炒作就来劲,并且这点钱对于老板来讲也不多,就当玩也不觉得亏。
    ahdw
        12
    ahdw  
       23h 8m ago   ❤️ 6
    这么算账的话,你买车的养车用车的钱,够你打车打一辈子。
    那为什么会有私家车市场?而且还不断普及、下沉?

    显然你少算了。
    sn0wdr1am
        13
    sn0wdr1am  
       22h 30m ago
    本地部署考虑的是安全,隐私,而不是经济性。
    ffalex
        14
    ffalex  
       22h 13m ago via Android
    本地部署首先追求的也不是省钱吧?你让 claude 生成张色图,人家也不干啊
    l1ve
        15
    l1ve  
       21h 58m ago
    你拿一个本身不是为了 AI 设计的产品去跑 AI ,然后说不是最佳选择?

    自建算力对外出售价是可以做到官方价格的 5-7 折,70%利用率下一年回本不是玩笑。

    你这就好比买了个玩具挖掘机,然后说这东西不是做工程的最佳选择
    shyrock2026
        16
    shyrock2026  
       21h 53m ago
    都算经济账了,没有考虑一下智能硬件在持续涨价?
    june4
        17
    june4  
       21h 42m ago
    @shyrock2026 把硬件持续涨价当常态了,看看以前内存是什么价,也就是这波 ai 突起产能跟不上,几年后可能又是一地鸡毛
    Frankcox
        18
    Frankcox  
       21h 39m ago
    你把两个问题混杂了。你说的成本问题是云端 vs 本地,而不是 mac 跑 AI 是否是最佳选择(相比于 Linux/Windows + Nvidia 显卡)。


    第一个问题算是日常问题了,你要只看经济成本云端自然有优势,但是本地模型配合 huggingface 的各种 jailbreak 破限,能提供完全无审核的内容,R-18,R-18G,极端内容等等。这对一些人来说就是刚需,更不用提其他对隐私安全有要求的企业人员。
    另外,很多任务并不需要很大很强的模型,不是所有人都要用 AI 作为 code agent 跑一堆高难任务超大上下文。我现在做文生图的 prompt 扩写,图像反推等都是用 qwen3.5-9B 的模型就能跑,效果还很不错。

    第二个问题,mac 称为本地 LLM 的最佳选择是因为 UMA 统一内存架构,Mac 内存价格是金子,那 Nvidia 显存的价格则是振金,而本地跑 LLM 的一个很大问题就是能不能把模型全塞到显存里。所以这么一看 Mac 相比于买显卡拼集群,反而是一个比较有性价比的选择。
    Need4more
        19
    Need4more  
    OP
       21h 25m ago
    @Frankcox 你的回答很有水平。你说的这些需求当然存在,但我说的是日常干活的情况下(大部分应该都是这么用的吧),考虑性价比和使用体验,mac 本地部署不是个好选择
    qiuhang
        20
    qiuhang  
       21h 21m ago
    个人正常用自部署包亏的,很多自部署的往往是用来搞些商业模型不让做的事。比如搞色情内容之类的。
    EdwardKot
        21
    EdwardKot  
       20h 46m ago via iPhone
    标题没问题,但是你正文里不在乎的东西可能恰好是别人最在乎的的东西,本地部署 LLM 和 api 的区别,花了钱的人并且买了机器本地部署的用一下就有很明显的体感区别,不是必要的话没人想花了大价钱再捏着鼻子用
    phrack
        22
    phrack  
       20h 40m ago
    > 唯一的优势就是隐私了,但是个人使用不在意这个。

    不是哥们,个人使用最在意这个,你是正常人吗

    再说,我本来就需要电脑,能跑 llm 只是附带的价值
    Joyflare
        23
    Joyflare  
       20h 31m ago
    API 适合干正事,本地模型适合干‘不能给别人看’的事。你跟官方 API 提那些限制级的要求试试?能跑起来就挺好了,要啥自行车啊。
    sillydaddy
        24
    sillydaddy  
       20h 31m ago via Android
    回本要分使用情景的,跑满负载肯定是可以一年左右回本的。你要非用 1M 上下文,全速输出这种,那肯定回不了,因为机器的限制就在那。但是你的使用情景如果能跑满负载,忍受对话速度稍慢些,上下文小些,那肯定可以很快回本。

    另外大厂不部署,并不能说明不能回本。最简单的例子,1 立方米仓库可以容纳的计算密度,可能就完全把这个排除了!何况还有前面提到的每个人使用情景都不相同,大厂部署根本没有个人灵活。

    楼主拿自己每天花费 25 元来说不能回本,完全是站不住脚的。
    Need4more
        25
    Need4more  
    OP
       20h 30m ago via iPhone
    @EdwardKot 欢迎你分享本地部署的使用体验,而不是盲从别人
    Need4more
        26
    Need4more  
    OP
       20h 16m ago
    @phrack 别人身攻击,这样显得你很没素质。
    jetsung
        27
    jetsung  
       19h 49m ago
    自己部署的,可不止 DeepSeek 的模型,可以部署各种模型。所以没有可比性。
    Gomoku2024
        28
    Gomoku2024  
       19h 45m ago
    首先,电脑不只是能跑 AI ,同样不耽误用来做其它工作,不要用其价格来与线上 api 相比,因为就算有 api 你大概率也是需要一台电脑,配置也不会很低;其次,本地无限跑,可以试多种模型,这是 api 无法体会到的自由;然后,隐私和安全,可以不用在意 AI 知道你的关键资料和信息,这也是一种难得的自由;再次,在线 api 天然有各种限制,而开源破解模型束缚就要小很多,可以教你造 he 弹,出 H 图,这也是需求。最后,128G 内存的 Mac ,五年后肯定能到一万的残值。
    phrack
        29
    phrack  
       19h 33m ago
    @Need4more 不是哥们你怎么给我扣帽子

    我说了个人都关心自己的隐私,你说个人不关心隐私,我不得问问你是正常人不?

    你以为的正常人是什么意思?
    Frankcox
        30
    Frankcox  
       19h 22m ago via Android
    @Need4more 我知道一个做文生图 lora 训练框架的开发者,因为打标 prompt 涉及萝莉等词语,开发过程中直接被 codex 封号,申诉也无效,这就是云端的问题。

    另外,如果你完全不考虑隐私安全敏感内容,只考虑性价比和能力,那肯定是云端强啊,fable 5 ,gpt-5.6 这些顶尖模型压根就不开源,你哪怕弄了个 1T 内存的 mac 也只能跑次等的 deepseek glm 等量化后的模型。

    所以这个问题本来就算不上问题,买 mac 跑本地模型的人压根就不会用到需要 fable 5 ,gpt-5.6 sol 极高,性能的模型,人家就是跑一些低等模型,你可以多去 reddit localllm 等逛逛,你就知道 qwen 3.8 27B 这种体量的模型已经是最受欢迎的了。deepseek 这种大型的模型都没几个人步数。

    最后,你可能低估了小尺寸模型的能力(我 4070 一直跑 qwen3.6 35B a3b ,这个模型已经能满足我日常 70 %的任务),严重低估了人们对无审核模型的需求(我知道几个搞 ai 色 q 的已经财富自由了)
    Need4more
        31
    Need4more  
    OP
       19h 11m ago
    @phrack 我没有要说服你的意思。但你要是现实里这样的态度和人交流,是会被打的。
    xing7673
        32
    xing7673  
       18h 52m ago
    比起经济性、隐私性,最主要的还是可用性
    ds v4 这种顶级 infra 在高峰期也有不可用的时候,对于 24 小时服务来说是完全不可接受的
    mac 跑 llm ,其他还有的优势是:
    物理:静音、功耗低(散热压力小,硬件损管工程要求低)、体积小、接口丰富有扩展性(甚至有逆向 lightning 接 pcie 的项目)、不亚于 4090 的内存速率
    逻辑:mac 系统、除 cuda 外的第二大模型运行生态 mlx 和活跃开源客户端 omlx

    综上:mac m5u 256 订单延后到 12 月不是没有原因的
    Need4more
        33
    Need4more  
    OP
       18h 44m ago via iPhone
    @xing7673 这个就和坚信那些买房是刚需的人一样,想买总能找到一百个理由说服自己。希望你能分享自己使用 MAC 跑本地模型的真实体验,直接打我脸。
    Need4more
        34
    Need4more  
    OP
       18h 38m ago via iPhone
    @Frankcox 你说的这些都对。我发帖的初衷是想说本地部署没有性价比和劣化的使用体验。考虑到 MAC 设备售价并不便宜,如果出于省钱目的消费的话,可能会让你失望。其他个性化需求当然存在,也很有价值,感谢你提供的信息。
    xing7673
        35
    xing7673  
       18h 23m ago
    @Need4more #33 我现在 24 小时跑新闻爬虫+本地模型工作流,不然我为啥说这个可用性问题。
    当然我选的是 48g 内存版本,比我有钱有预算的选 256g 更无可厚非。
    红迪里用 mac 玩 llm 的和用多卡级联的人数占比都差不多,玩 localllm 就是看自己需求,我机器想放在我床边,那不可能用任何带物理风扇的机器
    coefu
        36
    coefu  
       18h 14m ago
    本地用来搞算法创新,idea 验证,讲真我不会希望我的 idea 被云厂商知道,并拿去训练新的模型。

    可能是买 api 做的事,没什么卵价值,厂商都看不来,不屑于用来训练它们的模型,搞不好还污染他们的原始训练数据。😂
    EdwardKot
        37
    EdwardKot  
       17h 35m ago
    @Need4more #25 我有啥需要盲从别人的?我做的工作签了保密协议,我不知道 api 会不会泄露的情况下当然是我自己的本地 LLM 协助。你这人有点意思,你觉得你用不上,别人都是骗自己上的?然后呢?证明你是对的,我即世界?
    wwhc
        38
    wwhc  
       17h 25m ago
    云 API 的一个致命问题是稳定性及可靠性无法保证,保不准什么时候就降智了,根据这个 API 之前智力水准订制的产品的产出将可能出现不可预知的变化;或者如果企业订购的某一个 API 因为厂商模型升级而废弃,企业根据这个 API 订制的产品将可能需要根据新 API 中的模型的不同特性而重构。本地部署完全没有这个问题
    slowgen
        39
    slowgen  
    PRO
       16h 38m ago
    你假设的数据让你得到了错误的结论,因为你假设的 token 处理量太低了,当然如果你每天就用那么多,那确实回本周期慢。

    我用 4 卡 RTX Pro 6000 跑 Qwen3.8 Flash Next NVFP4 ,现在一天最多是跑 54 亿 token(有峰谷,不均匀),还是因为 SM120 在新模型 Day 0 支持不给力,降级到了 marlin 的 backend 数据,要是用新内核估计处理能力还能提升 20%。

    结合 Deepseek Harness 一个/goal 开放式任务可以跑 20 小时以上,最近我做了 xterm.js 移植到 dart 和 CSharp 的测试,然后用 Flutter 和 Avalonia 复刻 tabby ,并且自我迭代优化,几乎是每小时跑 1 亿 token 输入,25 到 30 万的 token 输出,缓存命中率一般在 98%~99%。按照 Qwen 官方定价每小时大概消耗 12~13 元。

    现在我的 M2 Ultra 跑 Qwen3.8 Flash Next 的 4bit 量化,短的上下文时,prefill: 538.1 token/s, decode: 55.2 token/s ,长任务会衰减,假设这个数据在 M5 Ultra 上不衰减(因为增强了 AI 部分计算性能),根据 M5 Ultra 对比 M2 Ultra 的带宽差异计算,decode 的 token/s 大概在 80 ~ 100 ,prefill 速度估计可以 x10 ,这个意义在与有 KV Cache 的部分不用重复 prefill ,跑 Agent 新追加的上下文一般是并发读文件,追加的文件到上下文里几乎秒处理完,保守点的估计每小时 3000 万到 5000 万的 token 应该有,对比官方定价每小时消耗 6 元,一个月是 4320 元,M5 Ultra 256G 的 24 期免息分期费用每个月是 3615 元。
    shmilypeter
        40
    shmilypeter  
       16h 13m ago
    买 M5 Max 加上大内存大硬盘的,其实很多都是有剪辑工作流需求的用户,自媒体创作者之类的。

    如果只是纯开发,M5 Pro 加上 32G 以上的内存,加上无限 token plan 其实就够了。
    wangzr
        41
    wangzr  
       16h 9m ago
    只有你的需求是需求,别人的需求就不是?
    chemzqm
        42
    chemzqm  
       15h 57m ago
    deepseek v4 flash 用这玩意涨价前一天都得 20 多,现在翻倍都不止
    yjiefl
        43
    yjiefl  
       9h 41m ago via iPhone
    本地只能跑一些专门的小模型可能好些
    shyrock2026
        44
    shyrock2026  
       8h 51m ago
    @june4 #17 op 的分析就是以三年的折旧期为期限考虑的。这波硬件涨价潮持续三年的概率非常大。
    edisonwong
        45
    edisonwong  
       7h 23m ago   ❤️ 1
    我们二十台 dgx 自部署给研发用,各种调优,生产体验就是垃圾
    只是为了合规,离线,不泄露而已
    Topmax
        46
    Topmax  
       7h 8m ago   ❤️ 1
    自己部署除了吃配置屎还要吃优化屎,简直屎上加屎
    HENQIGUAI
        47
    HENQIGUAI  
       6h 42m ago
    这个逻辑非常奇怪,首先一个笔记本不是服务器,不是说除了玩模型就不能干任何事,就算是工作站、服务器也没规定只能一次做一件事吧,另外非得买最新最大内存的配置吗,M3Max 96G 行不行?直接便宜一半,体感还不一定有很大区别。最后,三年折旧期的算法是 3 年之后残值为零吗,如果这样的话到时候我出 500 块钱人民币购买楼主的 M5 Max 128GB 可以不,1000 也行
    isbase
        48
    isbase  
    PRO
       6h 39m ago
    @lesismal 除了大企业和政企机构。 普通公司和个人使用 ZDR Provider 相比本地部署有啥问题么
    homcrazy1
        49
    homcrazy1  
       6h 27m ago
    自己部署你想让他干嘛就干嘛
    elboble
        50
    elboble  
       6h 5m ago   ❤️ 1
    我个人经验是,速度凑合用,主要是上下文空间比不上云部署。

    P40 ,24G 的上古算力卡,Qwen3.8-27B-GGUF ,开了 mtp 最高也可以到 20tps ,干点小活也可以;但是 32K 上下文真不够,随便改个程序就 OOM 了。

    我在想能不能把上下文放主存,是不是不可行,或者会慢的令人发指。

    再就是噪音散热,P40 250W 的跑到 100%,只有一个后来加的小涡扇直接起飞,温度 89 度。其实散热还是不行,1 分钟以上就会掉功率降速。家里不让用,记得上次投诉是把矿机放家里的时候。

    综上还是掏钱买社会化服务方便。
    moregun
        51
    moregun  
       5h 41m ago
    这个有点类似买云盘服务还是自己部署 NAS 。本地部署的可以无视审查,防止数据泄露。
    dushixiang
        52
    dushixiang  
       5h 38m ago
    再等 5 年绝对有更适合部署 AI 的硬件,现在的显卡都是通用需求
    Need4more
        53
    Need4more  
    OP
       5h 21m ago
    @HENQIGUAI 没说 mac 没用啊,如果你买 mac 的理由是部署大模型省 token 费,那就没用。而且,你确定 96G 能有体感吗?
    CS50
        54
    CS50  
       4h 51m ago
    API 没有 Uncensored 模型给你用
    Rorysky
        55
    Rorysky  
       3h 26m ago
    @kevan 云厂商要赚钱呀 哥
    Serefrefee
        56
    Serefrefee  
       3h 13m ago
    我非常惊讶从头看到尾只有楼上一个人提到了 Uncensored
    这里的人既然都这么规矩为何还会翻出来?
    我本地部署只有一个原因 就是公网上的大模型都是审查版本 我想让 AI 教我些特别的东西公网版本的教不了
    yshan
        57
    yshan  
       3h 9m ago
    自部署一个是隐私,还有就是可以部署 无限制版本,机器折腾玩够了出手说不定还能赚
    Tink
        58
    Tink  
       3h 2m ago
    厂商也在买 mac 啊,我不知道你们在哪看到说没有厂商买 mac 做算力的。

    OpenAI 已购买数万台 Mac 用于强化学习训练,Anthropic 则采用租赁方式使用 Mac。两家公司都将苹果电脑纳入 AI 研发流程。报道指出,英伟达已将苹果视为本地 AI 领域的头号竞争对手,原因是 Mac 在 AI 开发者群体中正获得越来越高的关注度。苹果官方数据显示,2026 财年第三季度 Mac 营收同比增长 29%,为各产品类别中增速最快。
    Need4more
        59
    Need4more  
    OP
       2h 45m ago
    @Tink 别误导大家,这些厂商采购 mac 不是用来做推理的,是用来测试 Computer-Use Agents 。
    tealerK
        60
    tealerK  
       2h 19m ago
    谁自部署模型是为了便宜自部署的?经典自己立靶子自己打
    Tink
        61
    Tink  
       2h 13m ago
    @Need4more #59 是做强化学习的啊
    strobber16
        62
    strobber16  
       2h 8m ago via Android
    qwen 3.8 27b aa 52 分=dsv4 flash 0731 = luna max
    chjqpmain
        63
    chjqpmain  
       1h 2m ago
    根据每个人不同的情况,不同的价值评判权重,
    本来就没有任何方案可以说是任何问题的绝对最佳方案,
    技术也没有一个可以全方位都碾压的好方案,总能挑出毛病了,这样也才可以进步,一旦什么东西说不能再进步了,已经完美了,那么就都是后续的打脸, 类似物理界曾经的大厦已经建成,两朵乌云 那些时候的话,
    爱因斯坦的话也动不动,经证实,祂又又又错了,或者祂曾经被认为错误的,又又又对了...

    毕竟 有之以为利,无之以为用, 祂的好处恰恰是祂的坏处,祂的坏处恰恰是祂好处的来源.


    一般一切评判观点都是说这句话的人,以祂当时的信息以及认识 才是可以相对合理的.
    我这里一般不说这种绝对的词,非要说,也说什么流氓论证之类的,才这样提出来, 有的人喜欢说自己说个暴论,有些类似.

    可能是个人习惯和性格吧, 或者就是为了对立的流量和利益,不然我是不知道为什么一个人要发表争议言论,然后对线,可能祂选择用这个方式来打发时间吧
    Need4more
        64
    Need4more  
    OP
       46 mins ago
    @chjqpmain 前面说的很有水平,可是最后开始揣测我的动机了和乱扣帽子了,我不太理解。任何观点是用来碰撞的,如果你要知道我的目的,那就是是为了听听还有什么不同的视角,不是为了说服任何人或者流量或者某些邪恶的目的。你作为看客如果觉得有启发,就没算我花费时间发这个帖子和做这些图表。

    当然,你觉得是胡扯,那直接喷我我也欢迎。
    sagnitude
        65
    sagnitude  
       36 mins ago
    @Tink 是用来训练 Agent 如何使用鼠标、如何调用系统功能,不是用来训练模型本身,不是用来做算力,他唯一的价值就是:提供 MacOS 环境
    chjqpmain
        66
    chjqpmain  
       34 mins ago via Android
    @Need4more
    你的标题和论点是 xxx 不是最佳方案,
    然后你内容里给出了你的情境和你的加权以及你这里的结论,

    我应该主观上没点你,可能给你带来误解了,

    我只是对 xxx 是绝对值 xxx 这种分享看法,

    我觉得治大国如烹小鲜,
    很多形而上学的道理是可以应用在具体情境里,
    从而分享的

    我要是要和你讨论,会引用你正文里的内容,然后提我的看法的,
    可是其实说到底就那点事,帖子已有的评论不都说遍了,就那几个角度,

    我就提了我的形而上学方面的分享
    Chicagoake
        67
    Chicagoake  
       27 mins ago
    当然不是最优选择,但是“隐私”和“完全掌控在自己手里”就足矣让很多人选择自己部署了。网盘的性价比也远高于 NAS ,但是买 NAS 的很大一部分用户是不愿意把照片视频交给平台,交给审查。
    Morgan2
        68
    Morgan2  
       17 mins ago
    @Chicagoake 飞牛用户:你说的对
    fe619742721
        69
    fe619742721  
       12 mins ago   ❤️ 1
    @ahdw 这个类比我觉得不合理。
    买车相比打车,带来的好处是更方便、更灵活,这对出行来说是非常重要的因素,对绝大部分人适用。

    自部署相比于云端 api ,带来的好处是隐私性,但这个使用 ai 模型时的隐私性对绝大部分人没那么适用。

    这两个适用人群的差异就会导致这个类比失效。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5274 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 107ms · UTC 09:03 · PVG 17:03 · LAX 02:03 · JFK 05:03
    ♥ Do have faith in what you're doing.