• 请不要在回答技术问题时复制粘贴 AI 生成的内容
blackantt
V2EX  ›  程序员

编程能力排名是 claude fable5 > gpt sol extra > claude 4.8 吗?

  •  
  •   blackantt · 1 day ago · 3677 views

    看到说,规划用 claude ,代码用 gpt 。 那具体编码能力是 claude fable5 > gpt sol extra > claude 4.8 吗?

    Supplement 1  ·  22h 47m ago
    fable5 还有 5 个模式,fable5 的 low 和 med 能打过 sol 的 extra ,pro 吗?
    30 replies    2026-07-23 18:11:01 +08:00
    mmdsun
        1
    mmdsun  
       1 day ago via iPhone   ❤️ 1
    个人感觉 kimi 3 和 GLM 5.2 比 GPT 写得好,但打不过 Claude 。参考编程能力排行榜

    https://arena.ai/leaderboard/code/webdev
    mooyo
        2
    mooyo  
       1 day ago
    差不多 体感上是这样
    zuosiruan
        3
    zuosiruan  
       1 day ago via iPhone
    体感好像是这么回事
    blackantt
        4
    blackantt  
    OP
       1 day ago   ❤️ 1
    @mmdsun 这个排行不靠谱,kimi3 排第 1 了。
    inyfee
        5
    inyfee  
       1 day ago via Android
    4.8 快没法用了
    gpt5
        7
    gpt5  
       1 day ago
    编程任务差不多是这样。但是其他任务就不一定了。
    fovecifer
        8
    fovecifer  
       23h 36m ago
    我经常使用 opus 和 gpt 进行互审,我的感受是 GPT 在细节上更好一点,opus 在整体架构上更好一点。
    hellojay
        9
    hellojay  
       22h 59m ago via Android
    sol 前端太差了我都让 Claude 出前端样式再让 sol 改
    david082321
        10
    david082321  
       21h 39m ago
    For coding rankings, I would separate public leaderboard scores from actual workflow fit: frontend polish, code-review quality, latency, and context handling can move the order quite a bit. https://kimi3.org/benchmarks/?utm_source=v2ex&utm_medium=comment&utm_campaign=kimi3_org&utm_content=benchmarks_1229132 is a useful Kimi K3 reference for checking benchmark context and practical trade-offs against Claude and GPT-style models.
    Thiece
        11
    Thiece  
       21h 33m ago
    大项目编程能力看 DeppSWE
    https://deepswe.datacurve.ai/
    JoeJoeJoe
        12
    JoeJoeJoe  
    PRO
       21h 19m ago via iPhone
    感觉得辨证着来👀这件事

    我目前还在用 gpt-5.5 哈哈哈
    terence4444
        13
    terence4444  
       18h 59m ago
    榜单迟早要被玩坏,就和之前无数的榜单一样。上一个被搞坏的应该是手机相机的榜单吧?
    gogozs
        14
    gogozs  
       12h 59m ago
    评论说某某第一的,是三个模型都用过?
    Sundayz
        15
    Sundayz  
       12h 58m ago
    现在头部几个模型能力差不多了,还搞排名意义不大了。
    poxiaohy
        16
    poxiaohy  
       12h 40m ago
    T0:Fable 5 、GPT 5.6 sol 、Kimi K3
    T1:opus-4.8 、GPT 5.5 、Grok 4.5
    T2:muse-spark-1.1 、Gemini-3.6-flash 、GLM-5.2
    blackantt
        17
    blackantt  
    OP
       12h 27m ago
    @poxiaohy Fable 5 、GPT 5.6 sol 里的主要 thinking 模式之间呢? 如果有 Fable 5(low, mid,high,...) 、GPT 5.6 sol(ultra) , 到底应该用哪个来编程?
    poxiaohy
        18
    poxiaohy  
       12h 16m ago
    @blackantt 不同子模型能力得综合各种排行榜来评价。至于实际工作,每个人遇到的项目复杂度不一样,对需求复杂度评判标准也不一样,具体用什么模型,只能靠自己的体感去体验。比如有的人任务复杂,需求量大,那就直接上 claude 和 GPT 最强的;有的人追求快,不想被封,也有一定性能,那 grok 挺好的;有的人偏爱国产,那就上 Kimi 和 GLM 。有的人需求简单,DeepSeek-flash 都够用了。
    loshine1992
        19
    loshine1992  
       12h 16m ago
    @mmdsun 这个是前端
    shunia
        20
    shunia  
       12h 1m ago
    @Thiece #11 没仔细看,请问链接里的第一个表是不是考虑到了性价比?我看 sol 比 fable 也便宜太多了。
    szthanatos
        21
    szthanatos  
       12h 1m ago
    @mmdsun webdev 榜单混元排 16 、qwen3.7-max 排 20 ,ds-v4-pro-thinking 31 ,榜单和现实差距太大了
    DICK23
        22
    DICK23  
       11h 38m ago
    gpt5.6sol 我的感受是明显优于 5.5 的
    mmdsun
        23
    mmdsun  
       10h 40m ago
    @blackantt kimi 3 写代码要比实际好很多,但是要深度思考开最大、测评也是用的 max GLM5.2 也是。如果不开最大就很差,简直两个模型。 现在有中转站都混用国产模型和 GPT/Claude 写代码已经看不出来了。我们公司内部也准备搞个测试实验针对写代码的情况盲测。
    mmdsun
        24
    mmdsun  
       10h 34m ago
    @loshine1992 模型编程能力一般都是选用前端的,因为前端好观察、量化打分。并且现在前端工程也不是简单 html 页面了、工程化也复杂 用来评估模型代码能力没什么问题的。Agent Arena 排行 Kimi 3 就掉到第三了。另外已知 GLM 5.2 要开 max 模式,也就是最大深度思考才能比得过海外模型。kimi 3 估计送测也是 max 模式吧 虽然排行没有写 实际感觉还是 max 最大思考深度 才会聪明一些。
    deplives
        25
    deplives  
       10h 25m ago
    我反而觉得 fable 5 是不如 5.6 sol 的
    上周我实验了好久,发现同样的 xhigh 的强度,
    不使用任何 skill 的情况下,在使用相同的 agent.mdclaude.md 的情况下
    纯后端无任何前端 UI 的 swift 6 代码
    新 feature 的情况下测试了十多次,fable 5 有概率写不出一次编译过的代码
    大概出现了 3 4 次(先不管功能是否正确,只管写完的代码能否一次编译通过) 但是 5.6 sol 从来没遇到编译不过的
    再和 UI 相关上,fable 就更是灾难,使用 /simplify 对 UI 部分的代码进行精简,结果就是精简完的代码完全改变了 UI 的样式,和交互逻辑。很自以为是,但是因为 codex 没有原生的 /simplify 就直接引用了 https://github.com/anthropics/claude-plugins-official/blob/main/plugins/code-simplifier/agents/code-simplifier.md 做了一些必要的修改后作为本地 skill 使用,结果比 fable 好太多了,不会出现 UI 被改变,交互被改坏的情况
    wwwwjack
        26
    wwwwjack  
       7h 30m ago
    @deplives 同感, 作为一个 iOS 开发, 从 gpt 5.5 以后的 iOS 代码, 不管是 swift 还是 OC 已经很少见到模型开发完成对应功能后(为省时间跟 token, 我 md 里强制要求改完代码后不要跑 build 检查), 编译有报错了, 使用其它模型, 还是能偶尔看到编译报错的情况
    yh7gdiaYW
        27
    yh7gdiaYW  
       5h 56m ago
    opus 4.8 现在排不到第 3 了;不差钱的话无脑开 max
    jackerbauer
        28
    jackerbauer  
       5h 20m ago
    感觉 Qwen3.8 Max 都比 5.5 强
    wu67
        29
    wu67  
       4h 57m ago
    体感 4.8 不如 4.6, 有些问题真的弱智到让我无语.
    jinsongzhaocn
        30
    jinsongzhaocn  
       3h 54m ago
    可能现在模型差距非常小,越来越不敢确定谁最强,只能说是各有优缺点。不过缺少图形能力的,比如 GLM 和 DS ,单项再强,也会感觉到短板。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3055 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 276ms · UTC 14:05 · PVG 22:05 · LAX 07:05 · JFK 10:05
    ♥ Do have faith in what you're doing.