VBk
V2EX  ›  智谱

大家有没有感觉国产 AI 编程其实已经挺能打了,就是太慢了

  •  
  •   VBk · 13h 18m ago · 3573 views

    最近 Kimi 、GLM 、DeepSeek 我都用了一些,我现在有个感觉,就是国产 AI 编程能力其实真没以前差那么远了。

    尤其 Kimi 和 GLM ,我自己体感大概已经能有 GPT 七八成吧。肯定还是 GPT 强,但是已经不是那种完全没法比的感觉了。有时候我 GPT 写完东西,再扔给 Kimi 或者 GLM review 一遍,它还真能给你找出来一点 GPT 漏掉的东西。

    所以我现在觉得拿国产模型做第二遍检查其实挺合适的。

    但是有一点我真的受不了,就是太慢了。

    同样一个东西,我用 GPT ,高思考模式可能三十秒就搞完了。换 Kimi 、GLM ,六七分钟都有可能。GLM 尤其慢,我感觉比 Kimi 还慢。有时候我都忘了刚才让它干嘛了,它还没跑完。

    DeepSeek 也是这个问题。

    然后价格这个东西我现在也有点怀疑。大家都说国产便宜,按百万 Token 算确实便宜,但是问题是同样干一件事,它消耗的 Token 好像也比 GPT 多不少。

    GPT 可能很快就把问题解决了,国产在那想半天,跑一大堆 Token 。最后真按一个任务算下来,我感觉 GPT 好像也没贵,甚至可能还更便宜。

    所以单看每百万 Token 多少钱,我现在觉得没啥意义。应该看同一件事最后到底花多少钱,还有花多长时间。

    我目前用下来的感觉就是 GPT 综合性价比还是最高。贵是看着贵,但是快,而且大部分时候一次就能把事干明白。

    国产里面我现在更喜欢 Kimi 一点,综合比较均衡。真要必须国产,比如数据比较敏感,那我估计还是会选 Kimi 。

    GLM 我感觉能力其实挺好的,尤其拿来 review ,但就是慢,真的慢。

    DeepSeek 现在我反而有点不知道用它干嘛了。以前便宜是个很大的优势,现在感觉也没有以前那么便宜,再加上还是慢,我自己用得越来越少。

    不知道你们有没有这种感觉?尤其是平时真拿这些东西写代码、跑 Agent 的。

    我挺想看看有没有人实际算过,同一个任务 GPT 、Kimi 、GLM 、DeepSeek 各跑一次,最后分别用了多少 Token 、多少钱、多少时间。我怀疑最后算总账,GPT 可能反而是最便宜的那个。

    Supplement 1  ·  7h 43m ago

    看了下大家回复,我现在反而更好奇另一个问题:

    你们觉得国产模型真正的“分界线”在哪?

    因为看下来好像小任务大家分歧挺大,有人觉得 GLM 很快,有人觉得 Kimi 慢,有人觉得 DS Flash 最好用,这个可能跟 harness、服务商、推理档位都有关系。

    但是复杂任务好像反而比较容易拉开差距。

    比如一个普通 CRUD、改几个接口、补点业务逻辑,国产现在基本都能干。可一旦变成多文件、上下文很长,或者那种根因不明显的 bug、多线程、渲染问题,我自己的感觉就是那一两成能力差距突然会放得特别大。

    不是 GPT 100 分,国产 80 分这么简单,而是可能:

    GPT 找到根因了,结束。

    国产找了半天,看了一堆文件,最后还是没找到。

    这时候 Token 再便宜也没什么意义了。

    所以挺想问问经常同时用国产和 GPT/Claude 的人:

    有没有什么任务是你已经基本不会交给国产模型做的?

    或者反过来,什么类型的任务你觉得国产现在已经完全可以替代 GPT/Claude 了?

    最好说具体一点,比如:

    • 普通业务代码:国产够用
    • 大项目 review:?
    • 疑难 bug:?
    • 重构:?
    • 从零写功能:?
    • 多线程/性能问题:?
    • 跑长时间 Agent:?

    我感觉这个可能比单纯比 benchmark 有意思。真正工作的时候,大家最后关心的还是“这个活我敢不敢交给它”,它会不会更快更省钱的完成。

    44 replies    2026-09-04 20:50:19 +08:00
    Nasdaq
        1
    Nasdaq  
       13h 14m ago
    都是义和团大模型,归根结底就是算力不够。没算力=训练和部署规模上不去=没有好用户和好数据=没有好工程反馈=没有正向循环=一直蒸馏美帝。
    Meursau1T
        2
    Meursau1T  
       13h 3m ago
    GPT 也挺慢的啊,不知道是不是因为 sol xHigh 和 max 本身就慢,反正每天也是看着他在那里磨叽。
    GLM 没用过,DS 涨价了没法写代码用,Kimi 确实还可以,我用 199 套餐的 K3 ,没感觉比 GPT 差在哪了,还多一个“说人话”的优势。大家都说 K3 慢,但我还是感觉没跟 GPT 的 sol max 速度差到哪去,都一样慢。
    Yukiteru
        3
    Yukiteru  
       12h 53m ago   ❤️ 1
    我觉得 deepseek-v4-flash 很好用,速度快而且也挺聪明,从回复风格之类的能明显看出来是根据 claude 训练出来的
    目前我给公司写代码基本都是 ds 了,glm 和 kimi 感觉太慢了还容易过度设计
    HTML001
        4
    HTML001  
       12h 49m ago
    GLM5.3 ,DeepSeek V4 Flash0731 ,公司内部国产模型免费用,用来用去还是觉得这两个好用。
    94
        5
    94  
       12h 48m ago
    能力的部分我的感觉和你差不多。但是产出速度的话,我的体感是反过来的。
    特别是在 Codex 中很明显我需要“等待”的(如果不是并行开发的话)。但是其他的国产 Agent 工具没有那么明显的“等待”感觉(大概 4 个工作区就能满足我不间断开发下去了,Codex 可能要 8 个以上)。

    感觉模型产出速度的快慢和 Agent 客户端 Harness 约束强弱是强相关的。也就是越强的约束产出速度越慢,所以我才感觉 Codex 会慢慢的。
    体验过最快的是 Cursor 刚出 Composer 2.5 的时候,我刚回车完还没几秒钟就结束了。当时还以为卡思考了,结果已经是干完了………
    Spirei
        6
    Spirei  
       12h 46m ago via Android
    DS-v4-flash 可比 Codex 快哦
    VBk
        7
    VBk  
    OP
       12h 45m ago
    @Meursau1T 我都是用 gpt 的 sol 中,已经基本可以达到我想要的效果了,xhigh 也不是推荐的用法, 这个增加思考深度,增加上下文。有点像超频,有点效果不显著。建议你管理下上下文改用中,速度很快,效果也不错。我这边同样的任务给 kimi ,小任务还好。大一点就显出来了。kimi 的思考链特别长,具体来说你可以扔给他们同时一两千行代码做修改分析。你就能对比出来了,而且 k3 额度消耗巨快!
    Moishine
        8
    Moishine  
       12h 44m ago
    不只是慢的问题,质量存在明显差异的。当然对于一般的需求,都完成的不错。
    VBk
        9
    VBk  
    OP
       12h 44m ago
    @Yukiteru 小任务 ds 还能用,大一些,ds 就跑偏。我反正不爱用,但是合规化的话有时候就没办法了。
    foryou2023
        10
    foryou2023  
       12h 43m ago
    op 可能用的是 dsv4 pro ,ds 涨价之后,用的人少了,dsv4 flash 超级快。
    VBk
        11
    VBk  
    OP
       12h 43m ago
    @Spirei 咱们得同样质量比速度,同样速度比价格啊,老大,没这么比的。
    Moishine
        12
    Moishine  
       12h 43m ago
    我曾经有个问题,让 DeepSeek 搞了两个小时都没弄好,Cursor 配合 GPT 5 三分钟找到根因完美解决。
    VBk
        13
    VBk  
    OP
       12h 41m ago
    @Moishine ai 的能力差两成就能决定这个 bug 能不能找出来了,就好像五十五分和六十分,差的不多,但是一个及格一个不及格。所以有时候我真懒得用垃一点的模型,太浪费时间。
    Moishine
        14
    Moishine  
       12h 39m ago
    @VBk 对,这时候 DeepSeek 花费反而更多(因为工作了很长时间,浪费了更多 token )
    heftyMan
        15
    heftyMan  
       12h 31m ago
    更多情况是翻墙,外卡,claude 卡国区的原因,不然有几个原因用国产
    qiuzhang
        16
    qiuzhang  
       12h 19m ago
    ds 和 glm 亲测,感觉能打,但还不是很能打。但已经进步巨大了。
    defaw
        17
    defaw  
       12h 10m ago
    sol 只是想的快,反而是慢的。
    maolon
        18
    maolon  
       11h 27m ago
    kimi 我反而是体感差的那个, 随便 review 个啥就要 6-7 分钟, 用 zai 的 5.3 平时大概有个 70-80 tps 不觉得慢,ds v4 flash 其实也不错速度挺快,只是最近 flash 级别模型发的太多了也用不上他
    netox
        19
    netox  
       11h 0m ago via iPhone
    总觉得模型是一个因素,推理架构和推理硬件是另一个因素

    就很同样的硬件,国内云厂和国外云厂商就是差那么一些
    afkool
        20
    afkool  
       10h 55m ago
    因为确实蒸馏老美的。。。不会差到那去。。主要还是太贵、低价方案还得抢。老美的订阅算下来实在太便宜了。
    cloudzhou
        21
    cloudzhou  
       10h 51m ago
    gpt 我使用感觉非常慢,很影响开发效率
    不够这玩意我在想,是否和服务提供方有关?所以快慢这个评判标准很主观?
    mechunjun
        22
    mechunjun  
       10h 50m ago
    你猜猜为什么总比国外模型慢一步
    duanxianze
        23
    duanxianze  
       10h 49m ago
    glm 就是慢,技术架构上就慢,主要还是太缺卡了,目前都是以国产卡为主
    XnEnokq9vkvVq4
        24
    XnEnokq9vkvVq4  
       10h 11m ago
    国产模型思考 token 用的特别多也是一个方面,因为规模相对小、要尽可能地压榨智力,所以就只能这样,但这就影响速度
    QlanQ
        25
    QlanQ  
       9h 58m ago
    glm 我感觉不光是慢,还是那种很容易 跑偏,明明已经是很简单的问题,甚至我都说出是具体哪个文件的问题,他还还是要绕一大圈,看好几十个文件去找问题,还贵的离谱,真的是贵的离谱,虽然我的需求也大,但是一个问题直接跑完我 5 小时的额度,也是离谱呀
    主要还是 DeepSeek 现在贵了,不然 ds 绝对是首选
    AEDaydreamer
        26
    AEDaydreamer  
       9h 51m ago
    中短期项目表现挺好, 偶尔听不懂指令. 还有 plan 实际折算 token 单价比 gpt sol 反而贵. sol 的 token efficiency 做的很好.
    daliusu
        27
    daliusu  
       9h 49m ago
    kimi 实际比 grok4.6 还强一些,grok 对我来说都已经足够覆盖我工作了,不过是慢到没法用
    Cloud9527
        28
    Cloud9527  
       9h 45m ago
    我们项目基本都是国产模型做的,前两个月主要用 mimo2.5PRO , 最近 qwen ,ds 啥都得都用。基本够用了
    tomaple
        29
    tomaple  
       9h 44m ago
    kimi 我预约了一个月了,都没结果。想用也用不了啊,而且 codex 各种送重置,我干嘛还折腾去用 kimi?
    jackerbauer
        30
    jackerbauer  
       9h 37m ago   ❤️ 1
    国模现在已经很不错了
    NizumaEiji
        31
    NizumaEiji  
       9h 28m ago   ❤️ 2
    我用了智谱大半年了,我买 codingplan 的时候这玩意儿甚至还在 v2 做推广,一直很疑惑的就是好像别人嘴里的 glm 和我实际用的 glm 完全是两个东西。

    看测评谁都说很厉害,但是我的感受也就是在少量任务上能感受到智谱的强大,一旦上下文稍微复杂一点 glm 就又慢又蠢,感觉就像是那种特别努力背了很多题的学生。要是你问的问题他从题库里找到他就能找猫画虎的搞出来一份东西,要是找不到那乐子大了,搞出来的玩意儿简直匪夷所思。
    cpper
        32
    cpper  
       8h 15m ago
    我们公司提供基本市面上所有模型;目前大部分游戏是偏向业务和逻辑的工作国产模型可以胜任。
    但如果是比较复杂的问题,例如多线程问题,疑难杂症,渲染异常,这些 claude 明显远远高于国产模型的能力,国产模型可能花了几百块钱绕来绕去搞不定,claude 同样这个时候花费几百块钱就搞定了。
    cpper
        33
    cpper  
       8h 14m ago
    我们公司提供基本市面上所有模型;目前大部分偏向业务和逻辑的工作国产模型可以胜任。
    但如果是比较复杂的问题,例如多线程问题,疑难杂症,渲染异常,这些 claude 明显远远高于国产模型的能力,国产模型可能花了几百块钱绕来绕去搞不定,claude 同样这个时候花费几百块钱就搞定了。
    liushengxian1230
        34
    liushengxian1230  
       8h 9m ago
    确实希望有这个测试,但是又觉得没什么标准,影响因素太多了。不同的 harness 效果、推理层级、实际工作中不同的任务难度、不同使用者的工作习惯等等,都会导致结果偏差。。
    fuchish112
        35
    fuchish112  
       8h 1m ago
    基础的 curd 工作,目前的几个 flash 都能很好的满足工作,当然核心方面,还是有一定差距,但这个差距其实可能就几个月的差距
    VBk
        36
    VBk  
    OP
       7h 58m ago
    @cpper 这也是我的感觉,就高级模型在高级任务上面反而省钱。但是也没人可以做一个测试。
    DinnyXu
        37
    DinnyXu  
       7h 34m ago
    你看看老美那边的硬件都是顶级的,肯定又快又强啊,如果我们硬件能有他们的 80% 你看看是不是综合比他们强。我说的是综合
    rickiey
        38
    rickiey  
       6h 38m ago
    感觉 qwen 的算力应该够的,但是卖的贵啊,而且模型有时候抽风
    zisen
        39
    zisen  
       6h 24m ago
    @94 #5 正确的,我用 dsh 的时候模型有时候会编造证据来骗我,本质还是偷懒,用 cc 的时候我让它改代码编译,它会啰里八嗦先跑半小时 review 要改的代码部分,除非我直接要求了不做任何检查去编译,都是接的国产模型,所以我干活偏向于用 cc ,哪怕慢点也不要骗我
    zisen
        40
    zisen  
       6h 23m ago
    @QlanQ #25 用的哪个 harness ,我发现和 harness 也有关系,dsh 倾向于直接开干,cc 和 codex 倾向于调查清楚了再开干
    knightdf
        41
    knightdf  
       6h 22m ago
    我体验下来是国模又贵又没资本模好用
    QlanQ
        42
    QlanQ  
       6h 13m ago
    @zisen #40 是的和 harness 关系非常大,我用的小众的 jcode ,但是 我用 zcode glm 也还是很慢。
    jwk345
        43
    jwk345  
       3h 54m ago

    看图说话
    resist
        44
    resist  
       2h 43m ago
    差距很明显,就那网页端的 ChatGPT 和 DeepSeek ,DeepSeek 根本找不出问题在哪,ChatGPT 一针见血,哎,差距多着呢
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2701 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 99ms · UTC 15:33 · PVG 23:33 · LAX 08:33 · JFK 11:33
    ♥ Do have faith in what you're doing.