foryou2023
V2EX  ›  问与答

如果 2 - 3 万人民币设备,部署本地 dsv4flash , token 基本够用,你是会选择本地部署还是接云 api?

  •  
  •   foryou2023 · 3h 27m ago · 1296 views

    The current q2 results use ds4-bench with the standard Promessi sposi input, 2048-token context steps, and 128 greedy generation tokens at every frontier. Each prefill number is for the next 2048-token chunk. The complete sweeps are in m5_max.csv and gb10.csv.

    Machine Backend Context Prefill Generation
    MacBook Pro M5 Max, 128 GB Metal 2048 790.18 t/s 39.35 t/s
    MacBook Pro M5 Max, 128 GB Metal 16384 572.53 t/s 36.14 t/s
    MacBook Pro M5 Max, 128 GB Metal 32768 557.04 t/s 34.36 t/s
    MacBook Pro M5 Max, 128 GB Metal 65536 398.50 t/s 27.64 t/s
    DGX Spark GB10, 128 GB CUDA 2048 825.76 t/s 18.05 t/s
    DGX Spark GB10, 128 GB CUDA 16384 872.44 t/s 15.10 t/s
    DGX Spark GB10, 128 GB CUDA 32768 855.94 t/s 14.43 t/s
    DGX Spark GB10, 128 GB CUDA 65536 822.98 t/s 13.84 t/s

    Older measurements for machines and model variants not rerun in this pass are kept for reference. They used the earlier CLI prompt procedure and are not directly comparable with the table above.

    Machine Quant Prompt Prefill Generation
    MacBook Pro M3 Max, 128 GB q2 short 58.52 t/s 26.68 t/s
    MacBook Pro M3 Max, 128 GB q2 11709 tokens 250.11 t/s 21.47 t/s
    Mac Studio M3 Ultra, 512 GB q2 short 84.43 t/s 36.86 t/s
    Mac Studio M3 Ultra, 512 GB q2 11709 tokens 468.03 t/s 27.39 t/s
    Mac Studio M3 Ultra, 512 GB q4 short 78.95 t/s 35.50 t/s
    Mac Studio M3 Ultra, 512 GB q4 12018 tokens 448.82 t/s 26.62 t/s
    Mac Studio M3 Ultra, 512 GB PRO q2 32768 tokens 138.82 t/s 9.56 t/s

    以上是看 https://github.com/antirez/ds4 这个仓库的数据。

    最近 dsv4 涨价太猛了,所以尝试找找本地部署的方案,找到这个方案,由于手里也没有设备同时也不太懂这个 速度的问题,也无法测试具体的实践效果如何,不知道有相关设备的朋友,能不能帮忙看看或者测试一下。

    目前看了咸鱼 M3 MAX 128G 的大概 2.5 万左右,感觉按照 dsv4 flash 的价格的话可以接受本地部署了。M5 MAX 苹果官网看了一下要 5 万多,暂时没有这么多预算。

    Supplement 1  ·  2h 52m ago
    看了大家的大部分人的回复,本地部署暂时不考虑,只能继续上云 api 了。
    20 replies    2026-08-24 13:42:28 +08:00
    donaldturinglee
        1
    donaldturinglee  
       3h 21m ago via iPhone
    2.5 万部署的能用在工作吗?生产环境还是直接上 API 吧
    cvooc
        2
    cvooc  
       3h 18m ago
    现在迭代这么快, 本地部署 每秒几十 token 只能个人同一时间跑单任务用, 除非极度缺乏安全感,
    真不如 api 跑批量来的爽.
    FakerLeung
        3
    FakerLeung  
       3h 4m ago
    我看双 DGX 好像能干到 4 人同时 50t/s ?还是 FP8 的精度?
    xing7673
        4
    xing7673  
       2h 57m ago
    你这又是 q2 又是几十 k 的上下文,部署起来也基本没啥用
    darksword21
        5
    darksword21  
       2h 55m ago
    没有意义,发这种 bench 的人也是闲的
    crocoBaby
        6
    crocoBaby  
       2h 54m ago
    很多人早算过这笔帐,肯定是云 api 划算的
    op351
        7
    op351  
       2h 48m ago
    现阶段肯定是直接买云服务商的算力
    云服务商都还在算力设备采购难,到货周期长,回本周期长的阶段,就不用想本地部署省钱这码事了
    现在本地部署的好处就一个 安全合规
    不存在本地部署吊打云服务商的算力和质量还能省钱的
    ff521
        8
    ff521  
       2h 39m ago
    hx170 这个破解的显卡有人玩过吗
    rming
        9
    rming  
       2h 36m ago
    如非必要 勿增实体
    xylitolLin
        10
    xylitolLin  
       2h 32m ago
    如果 2~3 万能部署到官方 api 的能力(能打个 8 折也可以)。官方也不至于涨价这么多吧
    longaiwp
        11
    longaiwp  
       2h 30m ago
    这还用算吗?就现在这个硬件成本,买 API 必然更划算。
    imdoge
        12
    imdoge  
       1h 40m ago
    不是满血版,还 40token/s ,一个人用都嫌慢还不是满血
    zisen
        13
    zisen  
       1h 37m ago
    如果考虑硬件涨价的背景,可以买来玩玩,记得在暴跌之前出手就行
    sillydaddy
        14
    sillydaddy  
       1h 34m ago
    DeepSeek 自部署可以 1 年左右就回本,但要跑满负载,单纯编程肯定跑不满。
    而且,考虑到各大厂的订阅套餐非常便宜,一般比 API 价格便宜 10x~20x 倍,订阅够用的话肯定订阅划算:
    https://v2ex.com/t/1235609#r_17991716
    Retas
        15
    Retas  
       1h 33m ago
    本地部署难崩的是算力只有下限,多个 Agent 就拉闸了。 用 API 跑上百个 Agent 并发洒洒水的事
    gpt5
        16
    gpt5  
       1h 27m ago
    本地部署有其应用场景 但绝不是来当主力代码 agent
    RandomJoke
        17
    RandomJoke  
       1h 26m ago
    你要达到 API 的推理效果,基本上硬件得投入百万级别。。。,还不算维护成本
    kuhung
        18
    kuhung  
       1h 24m ago
    除非极度重视隐私,不然写代码自己搞一套没有性价比。
    keppelfei
        19
    keppelfei  
       44 mins ago
    就目前市场看,2~3w 想部署一个 dsv4f,想常用感觉很困难
    geese1028
        20
    geese1028  
       32 mins ago
    我个人会选择订阅,不会考虑本地部署。3 万我可以把 super grok heavy 和 5x 的 GPT 订阅一整年了。1 年时间我觉得我的需求应该都能干完了。


    我个人并不在意大厂获取我的个人数据用于训练(我不用中转站)。如果我的数据对于训练下一代模型能有帮助,我将感到非常荣幸。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   6030 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 64ms · UTC 06:14 · PVG 14:14 · LAX 23:14 · JFK 02:14
    ♥ Do have faith in what you're doing.