majuzhang
V2EX  ›  Local LLM

公司本地部署开源模型

  •  
  •   majuzhang · 11h 42m ago · 4455 views

    想知道公司里部署一个可以供 20-40 人用的开源模型,需要大概怎样的硬件配置,一般会做文档处理,以及一些简单的编程

    47 replies    2026-08-14 20:40:10 +08:00
    owen800q
        1
    owen800q  
       11h 36m ago via iPhone
    5090
    majuzhang
        2
    majuzhang  
    OP
       11h 32m ago
    @owen800q 一张就够了吗,并发会不会很吃力
    owen800q
        3
    owen800q  
       11h 31m ago via iPhone
    @majuzhang 4 張
    Muze
        4
    Muze  
       11h 4m ago
    可以搜 技术犬,他们好像专门弄这个静音 AI 机箱,但是价格动不动就 50 到 80 万的,看预算吧,有机房的话,可以去找各大服务器厂家询价,例如惠普,戴尔之类的
    someonesnone
        5
    someonesnone  
       11h 2m ago via Android
    感觉得魔改大显存
    gpt5
        6
    gpt5  
       10h 52m ago
    看抖音上有人用 5000 块钱 diy 的丐版硬件部署 dsv4flash ,可以跑到 100tps 以上。
    Integ
        7
    Integ  
       10h 46m ago via iPhone
    4 张 RTX pro 6000 就够了。
    wu67
        8
    wu67  
       10h 44m ago
    除非数据有超常规格的保密要求, 不然还不如买套餐...本地跑单是商用电费就够你们喝一壶了
    malusama
        9
    malusama  
       10h 43m ago
    感觉现在本地部署根本不划算。。
    majuzhang
        10
    majuzhang  
    OP
       10h 27m ago
    @wu67 主要是财务会用,有保密要求,我也在考虑是本地部署的成本问题
    woscaizi
        11
    woscaizi  
       10h 26m ago   ❤️ 1
    现在 Agent 工具的上下文很大的,会导致 prefill 阶段很耗时。如果是 20-40 人使用绝对不是 4 张 5090 ,6000 就能搞定的
    majuzhang
        12
    majuzhang  
    OP
       10h 22m ago
    @woscaizi 其实就是说,本地部署的方案成本会很高而且不好用是么
    ttwxdly
        13
    ttwxdly  
       10h 8m ago
    少说 10 张 5090 。还有内存啥的,一点都不划算。
    hrapunzel
        14
    hrapunzel  
       10h 5m ago
    deepseek-v4-flash 高精度量化模型,两个 dgx spark 可以跑
    woscaizi
        15
    woscaizi  
       10h 4m ago
    部署 deepseek 、glm 、mimimax 之类效果好的开源模型用起来会很好,但不是低成本就能部署下来的。你可以调研下部署 deepseek-v4-flash 需要多少钱,它的部署需求基本是最低的。如果是部署 qwen3.6-35B 级别,需要的资源少,但是任务成功的概率低。
    beefhotpot
        16
    beefhotpot  
       9h 47m ago
    deepseek-v4-flash ,2 张 rtx pro 6000 可以跑。
    zsj1029
        17
    zsj1029  
       9h 46m ago
    h20 141 两张就够了 ds flash 很强,一步到位不要扣扣嗖嗖最后什么也搞不好
    dcatfly
        18
    dcatfly  
       9h 39m ago
    如果你本身比较了解模型相关的概念,可以参考 https://apxml.com/zh/tools/vram-calculator
    如果本身不了解,可以直接拿你的需求问 chatgpt ,再结合上面的做参考
    qiuhang
        19
    qiuhang  
       9h 36m ago
    @woscaizi #15 qwen3.6-35B 这种级别的,好一点的家用台式机都能跑
    woscaizi
        20
    woscaizi  
       9h 34m ago
    可以跑是一回事,能真的用起来是一回事。况且是 20-40 人使用
    Inn0Vat10n
        21
    Inn0Vat10n  
       9h 33m ago
    你要先说预算, 几十万,几百万,几千万,体验是完全不同的
    darksword21
        22
    darksword21  
    PRO
       9h 30m ago
    肯定 rtx pro 6000
    94
        23
    94  
       9h 19m ago
    之前收集过一段时间信息,总结时就是 50 万起步最低档,而且只是低可用的状态。所以最后是找阿里谈商务,保密的部分合同上面写清楚就是了。
    wwhc
        24
    wwhc  
       9h 17m ago
    1 到 2 张 RTX 6000 + Qwen3.6/3.8 27B + llama.cpp 应该够你们公司用了,不建议用 vLLM ,推理速度可能快些,但输出质量不如 llama.cpp
    edw1n
        25
    edw1n  
       9h 8m ago
    当前最具性价比的方案就是 2 台 NVIDIA DGX Spark 来部署 deepseek-v4-flash 。价格可以控制在 8 万以内,基本可以满足 20 人同时使用的性能。
    allinQQQ
        26
    allinQQQ  
       8h 47m ago
    2 台 NVIDIA DGX Spark 部署 deepseek-v4-flash
    GB10 性能比较差,双机基本只能 1~4 个并发
    yanest
        27
    yanest  
       8h 47m ago via Android
    我们这边有数据中心用的 5090 货源,8 卡,五十多万,最近又涨了一点。不过性价比很高,他们说的 pro6000 十万多一张没有性价比,如果模型能用 5090 跑起来是当前最优解
    yanest
        28
    yanest  
       8h 46m ago via Android
    五十多是整机
    molvqingtai
        29
    molvqingtai  
       8h 42m ago
    GPT luna 不是免费了吗
    restkhz
        30
    restkhz  
       8h 41m ago
    取决于预算。
    勉强能跑起来交差的,五位数不到,跑个 Qwen3.6-35B-A3B 还是够的,文档处理,简单编程能做。不过搞好了没几个人想用。
    5 位数算力带宽都好点的可以考虑比如还有几个小时就要发布的 Qwen3.8-27B ,能用。跑 Dense 要注意带宽。

    好用点的,能长期用的准备差不多 6 位数了。准备将近 200G 的显存吧。

    我这有用 H100+vLLM ,4K 上下文并发几十也没毛病。不过跑 Agent 上下文到 100K+明显卡 prefilling 。仅供参考。
    enihcam
        31
    enihcam  
       8h 35m ago
    4 台 NVIDIA DGX Spark
    VeteranCat
        32
    VeteranCat  
       8h 18m ago
    需要的显存至少按照 250G+准备,模型 v4 flash 就够用了,目前这个阶段的话是这样的。

    如果跑 Qwen,Qwen3.5-122B 也差不多了,不会说胡话,能跑代码,能跑文档。
    shmilypeter
        33
    shmilypeter  
       8h 14m ago
    如果只是十个人以内用的话还好,其实一台 Mac Studio 或者说 4 张 5090 就可以。但如果你要五十个人的并发,而且还要高级模型的话,至少得准备百万级别的预算,而且还要配备机房和专门的维护人员。
    ndxxx
        34
    ndxxx  
       8h 0m ago via Android
    @zsj1029 你这个方案大概是多少人用
    sankeff
        35
    sankeff  
       7h 6m ago
    这个我是真部署了,4 张魔改 4090 48G 的卡;
    DeepSeek-V4-Flash 几乎只能一个人用。
    稍微流畅点儿的用的 Qwen3.6-35B-A3B
    hisunny
        36
    hisunny  
       6h 59m ago
    给你个参考,4 块 V100 32G ,NVLINK 一代总线,用 lmdploy 跑 Qwen3.6-35b-a3b ,单线程能到 140 tps 。跑 Qwen3.6-27b 稠密,单线程能到 100+ tps 。整机 DGX-1,8 个 V100 ,当年(差不多 10 年前)卖 100 万。
    ssiitotoo
        37
    ssiitotoo  
       6h 57m ago
    可以租算力,我们公司租了 A800 40G 8 卡 一年 14w
    Mzs
        38
    Mzs  
       6h 26m ago
    正经 50 人用 平头哥芯片 16 卡私有化部署 glm5.2 400w 元 勉强能支撑
    superkkk
        39
    superkkk  
       6h 0m ago
    5090 跑 27b 的 qwen dense 模型 nvfp4 量化,或者 2 卡 pro6000D 跑 deepseek v4 0731 nvfp4 的量化
    tcper
        40
    tcper  
       5h 39m ago
    用买硬件的钱充 codex 或者 claude ,用到公司倒闭都用不完
    pkxutao
        41
    pkxutao  
       5h 22m ago
    真有意思,这个帖子让我见识到,哪怕是程序员,也存在不认真看内容、只想按自己的想法回答的现象
    wqhui
        42
    wqhui  
       5h 20m ago
    最近刚刷到别人计算了一下,除非高强度使用,不然本地部署比买贵几十倍,差不多 20 年回本
    Lighfer
        43
    Lighfer  
       5h 4m ago
    实际经验告诉你:4*5090 部署 Qwen3.6 27B NVFP4 够了,我们 vllm 部署并跑了两个月了。

    我们部门 100 号人,实际在用这个模型的大概也就是三四十号人的规模,日常也就 4~6 个并发请求,缓存命中率最低 75%左右,有一段时间维持在 94%左右。

    除了确实偶尔会卡顿一下(来了个大请求 prefill 占了资源),日常还是很流畅的,多数时候每个请求基本都能维持在 40~75 tok/s 。

    当然,如果你们是要用来疯狂 vibe coding 那肯定就不行了,不过这个模型也达到可以随意 vibe coding 的能力。

    放几条日志上来看看,不是瞎说(贴图太麻烦了直接贴文本):

    ```
    (APIServer pid=1) INFO 08-14 07:32:44 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 6927.3 tokens/s, Avg generation throughput: 211.5 tokens/s, Running: 7 reqs, Waiting: 0 reqs, GPU KV cache usage: 17.3%, Prefix cache hit rate: 75.5%, MM cache hit rate: 0.0%
    (APIServer pid=1) INFO 08-14 07:32:44 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.77, Accepted throughput: 135.20 tokens/s, Drafted throughput: 152.80 tokens/s, Accepted: 1352 tokens, Drafted: 1528 tokens, Per-position acceptance rate: 0.931, 0.839, Avg Draft acceptance rate: 88.5%
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO 08-14 07:32:54 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 3843.2 tokens/s, Avg generation throughput: 382.0 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.8%, Prefix cache hit rate: 75.7%, MM cache hit rate: 0.0%
    (APIServer pid=1) INFO 08-14 07:32:54 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.73, Accepted throughput: 241.65 tokens/s, Drafted throughput: 280.15 tokens/s, Accepted: 2417 tokens, Drafted: 2802 tokens, Per-position acceptance rate: 0.916, 0.809, Avg Draft acceptance rate: 86.3%
    (APIServer pid=1) INFO: xxxxx - "HEAD / HTTP/1.1" 404 Not Found
    (APIServer pid=1) INFO: xxxxx - "HEAD / HTTP/1.1" 404 Not Found
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO 08-14 07:33:04 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 1300.6 tokens/s, Avg generation throughput: 332.5 tokens/s, Running: 2 reqs, Waiting: 0 reqs, GPU KV cache usage: 4.8%, Prefix cache hit rate: 75.7%, MM cache hit rate: 0.0%
    (APIServer pid=1) INFO 08-14 07:33:04 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.75, Accepted throughput: 211.70 tokens/s, Drafted throughput: 242.61 tokens/s, Accepted: 2117 tokens, Drafted: 2426 tokens, Per-position acceptance rate: 0.913, 0.832, Avg Draft acceptance rate: 87.3%
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO 08-14 07:33:14 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 4531.0 tokens/s, Avg generation throughput: 204.7 tokens/s, Running: 4 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.4%, Prefix cache hit rate: 75.6%, MM cache hit rate: 0.0%
    (APIServer pid=1) INFO 08-14 07:33:14 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.90, Accepted throughput: 134.06 tokens/s, Drafted throughput: 141.16 tokens/s, Accepted: 1341 tokens, Drafted: 1412 tokens, Per-position acceptance rate: 0.970, 0.929, Avg Draft acceptance rate: 95.0%
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO 08-14 07:33:24 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 10786.8 tokens/s, Avg generation throughput: 173.7 tokens/s, Running: 7 reqs, Waiting: 0 reqs, GPU KV cache usage: 16.6%, Prefix cache hit rate: 75.6%, MM cache hit rate: 0.0%
    (APIServer pid=1) INFO 08-14 07:33:24 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.83, Accepted throughput: 111.99 tokens/s, Drafted throughput: 122.59 tokens/s, Accepted: 1120 tokens, Drafted: 1226 tokens, Per-position acceptance rate: 0.949, 0.878, Avg Draft acceptance rate: 91.4%
    ```
    zsj1029
        44
    zsj1029  
       4h 59m ago   ❤️ 1
    @ndxxx 至少 20 人,vllm 一点参数调优,基本都是运维的工作,没有什么研发的内容
    pingpp00
        45
    pingpp00  
       4h 0m ago
    可以看看懒猫微服,他们有一个算力仓 128GB 内存,性能不知道咋样,你可以问问
    ndxxx
        46
    ndxxx  
       2h 50m ago via Android
    @zsj1029 那这个成本还是挺高的😂
    Zhepro
        47
    Zhepro  
       7 mins ago
    现在最便宜的应该是 170hx,单张卡 64g 显存六千多块钱
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2758 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 113ms · UTC 12:47 · PVG 20:47 · LAX 05:47 · JFK 08:47
    ♥ Do have faith in what you're doing.