• 请不要在回答技术问题时复制粘贴 AI 生成的内容
baicai321
V2EX  ›  程序员

有一说一, DeepSeek V4.1 跑分还行,但实测还是和 Astra 有巨大差距

  •  
  •   baicai321 · 3h 41m ago · 1072 views

    今天用了下 DeepSeek V4.1 Flash ,快是真 TM 的快,一直稳定接近 300tok/s ,但在做复杂任务的时候,是真的蠢啊,尤其是和 Astra 比

    我今天主要是拿它们来进行一些老手游的反编译和修改(都是已下线的游戏),这个任务其实很麻烦,会遇到各种各样的难题需要模型去解决,DeepSeek 全程疯狂输出 Token ,然后遇到难题就想方案 -> 改代码 -> 问题还在 -> 换方案,一直在重复这样的循环,就 TM 跟鬼打墙一样,关键是这个逼速度还飞快,所以你就看到它疯狂的吐 Token ,疯狂的换方案,最后狂奔 40 多分钟问题没解决,完事还把之前的一个已经破解的模块改坏了

    实在受不了于是换了 Astra High ,Codex 不会展示完整的思维链,tok/s 相比于 DeepSeek 也慢不少,所以对比之下 Astra 就像一个慢吞吞的老头,不紧不慢的,但它是真的稳啊,任何问题遇到后基本两轮之内必能找到正确的方案,然后修复,同样的时间内 DeepSeek 可能已经尝试了 10 个方案了。连续几次都是这样,DeepSeek 疯狂穷举方案反复横跳最后无果,换 Astra 1-2 轮解决

    感觉高难任务上国模差距还是非常明显,虽然 Token 速度拉上来了但体验是真的差

    30 replies    2026-09-13 01:06:22 +08:00
    milkleeeeee
        1
    milkleeeeee  
       3h 36m ago   ❤️ 1
    道理我都懂,但是这俩模型价格差了几十倍是怎么能拿来进行比较的
    royzxq
        2
    royzxq  
       3h 26m ago
    道理我都懂,但您不看看 ds v4.1 什么价格,astra 什么价格?
    baicai321
        3
    baicai321  
    OP
       3h 25m ago
    @milkleeeeee 问题就是,我事后算了下,在这个任务,两者的花费并没有差几十倍,可以说一个数量级,DeepSeek 跑了一个小时没有解决,API 花了 15 块,Astra 用了 3%的周额度,相当于 3 美刀,20 块钱
    sampeng
        4
    sampeng  
       3h 24m ago via iPhone
    国产模型现在就是一个主打疯狂思考,然后啥又没干
    baicai321
        5
    baicai321  
    OP
       3h 18m ago
    @baicai321 算错了,100 美刀是月付,3%周额度还没有 3 美刀,这么看 Astra 其实更便宜。。。
    milkleeeeee
        6
    milkleeeeee  
       3h 15m ago
    @baicai321 你这就好比拿刚毕业的大学生和已经有 10 年工作经验的资深工程师做对比,大学生要花一个月还做不好,花费一个月工资 3000 ,然后你 1500 外包给资深工程师他做的又快又好。于是你得出结论:大学生和资深工程师有巨大差距
    fighterhit
        7
    fighterhit  
       3h 6m ago
    你多教教 ds 嘛
    mushuanl
        8
    mushuanl  
       3h 6m ago
    但是 deepseek 还是能干活,特别是 gpt 额度不够的时候。
    还有一点是 gpt 怀疑在套代码和思路,我一次下午发现用了十几个 G 流量,联系到最近一直又是额度复位又是 pro 限制等等,就是鼓励大家多用不同想法的人用,这跟以前一直先搞一波营销,然后动不动降智很不一样。

    怀疑他们的模型能够抽取大家思维,或是他们的记忆模块有了新进步,可以快速检索记忆。或是根据这些信息进行下一步训练。
    icyalala
        9
    icyalala  
       3h 0m ago
    @milkleeeeee 那这结论没错啊...
    tgfbeta
        10
    tgfbeta  
       2h 56m ago
    就是贝吉塔和孙悟空啊
    zed1018
        11
    zed1018  
       2h 55m ago
    @milkleeeeee #5 那这结论哪里错了呢?
    413420
        12
    413420  
       2h 54m ago
    @milkleeeeee 有...什么问题?不知道在激动什么
    ybybwdwd
        13
    ybybwdwd  
       2h 50m ago
    你拿一个 500 多 B 的模型和不知道几个 t 的模型比啥。。。
    jacketma
        14
    jacketma  
       2h 47m ago
    中学生做高数,题没看懂,打字快没有用啊
    extrem
        15
    extrem  
       2h 44m ago
    特别复杂的,特别需要自主探索,多步推理的这种涉及多个目标任务是不能放任小模型去做的,多步骤执行时他会陷入局部最优盆地里去

    但是如果你给出足够的信息,定向完成某个具体任务那么他就能做的很好,其实大部分场景也就是这样

    如果真的遇到特别复杂场景,使用小模型的方式应该是自己手动规划任务,引导其执行
    milkleeeeee
        16
    milkleeeeee  
       2h 43m ago
    @icyalala
    @zed1018 结论是没错啊,但“大学生跟资深工程师有巨大差距”这个结论很显而易见,这两者压根就没有可比性

    @413420 我没激动啊,倒是你是不是 ai 用多了已经丧失基本的判断能力了
    JasonYip
        17
    JasonYip  
       2h 41m ago
    v4.1 flash 最大就 A16B ,指望不了做什么特别难的任务。最强模型出 spec ,ds 来执行就没得问题
    413420
        18
    413420  
       2h 31m ago
    @milkleeeeee 看你一个人在那诡辩
    milkleeeeee
        19
    milkleeeeee  
       2h 25m ago
    @413420 连讨论和诡辩都分不清楚,你估计就是那种 ai 说啥都同意的
    himawari8
        20
    himawari8  
       2h 22m ago
    @sampeng 这不就够了?市场策略没有毛病

    面向国内消费者,只需要:
    - 质量怎么样其实不重要,关键是定价要便宜,便宜,还是便宜;
    - 要在容易看见/感受的地方,把所有的功能塞满。满足消费者的获得感和实惠感,以给足“捡了大便宜”的情绪价值。
    webcape233
        21
    webcape233  
       2h 20m ago via iPhone
    api 价格和套餐价格,其实比不合适。主要是 ds 也不出套餐
    SanjinGG
        22
    SanjinGG  
       2h 13m ago
    @milkleeeeee #16 好像挺有可比性的吧,现在主流不就是找 3 年左右经验的+AI 代替 5 年+的人嘛
    qqlax
        23
    qqlax  
       2h 9m ago
    高中生怎么跟博士生比... ds 快就是好,处理小问题,-p 回复其实就挺好
    noahhhh
        24
    noahhhh  
       2h 5m ago
    国产模型逆向用下来只有 Kimi K3 感觉最强,我让它把好些 macOS 现在不支持的 Intel 32 游戏逆向修改支持了 Arm 64 。

    Flash 模型干点简单活还行,复杂的就很吃力了,像信创 Linux ,ARM 处理器用了远古内核史前 Glibc 魔改 Wayland ,让 GLM 5.3 Flash 装个浏览器都费劲,让 Astra 弄不仅装好还帮 XWayland 缩放 bug 和 GPU 加速搞定了。
    659746321
        25
    659746321  
       2h 1m ago
    astra high 给一个功能写的我目前 95%一以上都是一遍过,如果没过基本是我没说清楚,然后 claude 审核代码修改后。我是查不出漏洞。
    noahhhh
        26
    noahhhh  
       1h 53m ago
    @icyalala 这不一样呀,我让模型用正则匹配快速复制 NAS 文件到本地,小模型直接多线程开干了,之前用 GPT Sol 来干,我出门一趟回去还卡在生成校验 MD5 。
    gloeaerris
        27
    gloeaerris  
       1h 28m ago
    claude opus + medium 有同样的问题,总是觉得这样做就可以,然后没解决问题又说自己是推测的,下次继续犯错,思考等级提高只是减少次数,问题该有还是有,gpt 从 5.5 一直用到现在,纠正了一段时间后就不再犯这种错误,估计积累了不少记忆,token 消耗明显快得多,我觉得对比一定要用干净的独立环境处理同样的任务,不然就不公平。社区里很明显:一直用 gpt 的人改用 claude 就觉得 claude 不太行,一直用 claude 的改用 gpt 也会觉得 gpt 蠢,不用全新环境体验肯定不一样
    stardust21
        28
    stardust21  
       1h 28m ago
    5L 结论没错,所以没有必要去论坛发帖:“大学生看起来聪明,但是实际打交道还是和资深工程师有巨大差距”,这个不是说一个大家都知道的常识么?
    Jooooooooo
        29
    Jooooooooo  
       1h 22m ago
    很早就有讨论过,做到和 gpt/fable 一样的事情,性价比最高的还是这两家。

    其它的看起来 token 便宜,实际干活并不便宜
    yuzo555
        30
    yuzo555  
       38 mins ago
    Codex 的订阅,尤其是 Pro 20X ,完成单个任务的单价其实很低的,他足够聪明,大部分不太复杂的任务可以一遍过,然后他还会隔几天重置一次,综合算下来,价格不一定比 DeepSeek API 贵。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   1252 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 65ms · UTC 17:44 · PVG 01:44 · LAX 10:44 · JFK 13:44
    ♥ Do have faith in what you're doing.