• 请不要在回答技术问题时复制粘贴 AI 生成的内容
fankcoder
V2EX  ›  程序员

大模型排行榜到底哪个权威?

  •  
  •   fankcoder ·
    fankcoder · 1 day ago · 7928 views

    Qwen3.8-max 出了,今天看排行榜 3 个榜 3 个名次,该信哪个呢?

    1. 排行第 4 https://arena.ai/leaderboard/code/webdev
    2. 排行第 7 https://llm-stats.com/
    3. 第十名之后去了 https://artificialanalysis.ai/leaderboards/models
    59 replies    2026-08-05 16:57:59 +08:00
    vzextreme
        1
    vzextreme  
       1 day ago
    看厂商对哪家测评机构特调🐶
    cowcomic
        3
    cowcomic  
       1 day ago
    arena 是匿名对比得分,这类稍微更偏向普通人的感官,我个人比较倾向这种竞技场排行的
    其他数据集评测的主要还是看测试数据分布和泄露情况了

    中文也有榜单
    https://www.superclueai.com/homepage
    tcper
        4
    tcper  
       1 day ago   ❤️ 9
    看评分标准,
    arena 就是通过匿名选择喜好,体现用户体验
    llm-stats 是多个评分集的聚合
    AA 自建评测集,这些集体现大模型对未知问题的推理能力

    不过客观来说,llm-stats 的聚合更能体现全面成绩,因为就算刷烂的题目成绩很好也不错了,起码能覆盖日常遇到的问题,并不是大模型都要去解决未知问题。
    lel020
        5
    lel020  
       1 day ago
    牛马 agent 使用还是得看社区评价,什么跑分都靠不住,
    Bootis
        6
    Bootis  
       1 day ago
    arena 都是 one shot 提示词任务,大型工程的复杂任务能力看这个榜单参考价值不大
    fankcoder
        7
    fankcoder  
    OP
       1 day ago
    @tcper 感谢
    opeth
        8
    opeth  
       1 day ago
    我基本上就看 artificial analysis 和最强野榜 https://llm2014.github.io/llm_benchmark
    wang93wei
        9
    wang93wei  
       1 day ago
    我个人觉得 DeepSWE 这个更权威一些。https://deepswe.datacurve.ai/
    klion
        10
    klion  
       1 day ago   ❤️ 1
    https://artificialanalysis.ai/leaderboards/models 里面重点关注这几个指标就知道,这些才是真正的模型智能

    Terminal-Bench Hard

    AA-Omniscience Accuracy

    Humanity’s Last Exam

    GPQA Diamond
    xiaoxixi
        11
    xiaoxixi  
       1 day ago
    好多排行站,之前都没关注过
    soulflysimple123
        12
    soulflysimple123  
       1 day ago
    https://artificialanalysis.ai/
    我看 Qwen3.8-max 里面还没有
    sillydaddy
        13
    sillydaddy  
       1 day ago
    我目前只看 arena ,它是基于两两比赛得到的,裁判是广大用户。
    rich1e
        14
    rich1e  
       1 day ago
    排行榜上的权威与真实体验,一些情况下并不相符合

    就像,在国产模型上使用 CC ,编程体验也还不错,但是遇到一些特定场景(视频分析 / 复杂逻辑推理),可能就不能工作

    - 视频分析时,可能会用到 claude vision
    - 复杂逻辑推理,会触发多个模型之间并行工作( Opus / Haiku / Sonnet )

    以上这些,如果模型没有适配,CC 就无法工作

    所以,大模型排行榜看看就好,权威也改变不了真实体验

    推荐这个,https://x.com/karpathy/status/2083749667410727319
    nakun233
        15
    nakun233  
       1 day ago
    当然是 DeepSWE 1.1
    kuhung
        16
    kuhung  
       1 day ago
    我个人还关心价格,即性价比。到了当前阶段,模型提升带来的体验上升已经很难如年初 opus4.6 那样了。我自己写了一个 https://www.traktoken.com/ 用来比价。此外,开发过程中还发现国外金融机构在观测 token 支出指数,用来指导投资,所以复现了一个 https://www.traktoken.com/spend-index 。从落地页来看,后者目前占一半的流量。
    sxbaixing
        17
    sxbaixing  
       1 day ago
    千问向来是跑分高,体验差
    mmdsun
        18
    mmdsun  
       1 day ago via iPhone
    论知名度还是 arena 靠谱
    OumaeKumiko
        19
    OumaeKumiko  
       1 day ago
    竟然还没有人发东山奈央的😂 俺也不知道是否权威
    [toyama nao - 知乎]( https://www.zhihu.com/people/toyama)
    uncleroot
        20
    uncleroot  
       1 day ago
    不知道有没有各种语言的“人味”排行。机器味太重了
    wakarimasen
        21
    wakarimasen  
       1 day ago via Android
    权威这两个字令人困惑。

    如果你要权威数据应该看厂商发布的第一方数据
    Wcowin
        22
    Wcowin  
       1 day ago
    具体场景具体分析吧,适合自己就是最强的。
    jonsmith
        23
    jonsmith  
       1 day ago
    编程方面不看好 Qwen ,跟 Gemini 一样,跑分高、编程能力不行。
    cabudad
        24
    cabudad  
       1 day ago
    什么排行榜都没有自己亲身使用权威,好不好用了才知道
    SeleiXi
        25
    SeleiXi  
       1 day ago
    让 gpt 找一些比较新+作者比较权威的 benchmark 调研一下,一般比较老或者比较有影响力的早就过拟合过了
    ybybwdwd
        26
    ybybwdwd  
       1 day ago
    @cowcomic arena 是可以刷的,可以用提示词试出是哪个模型
    levn
        27
    levn  
       1 day ago
    普通人类评价早就已经没用了在大多数时候
    jark006
        28
    jark006  
       1 day ago
    我比较信 DeepSWE
    Bootis
        29
    Bootis  
       1 day ago
    escapefear
        30
    escapefear  
       1 day ago
    我奉行对标谁就用谁的原则
    LK996
        31
    LK996  
       23h 59m ago
    和手机评测一样,都是给够前就上的婊子,没有干净的
    Znemo
        32
    Znemo  
       23h 47m ago   ❤️ 1
    哪个 Gemini 排名最低相信哪个。
    William337
        33
    William337  
       23h 47m ago
    没有,需要自行判断,仅供参考
    Haku
        34
    Haku  
       23h 41m ago via Android
    arean 是竞技场天梯,分数有保障,但是仅限前端(编程是只有前端)
    aes114514gcm
        35
    aes114514gcm  
       22h 53m ago
    @OumaeKumiko 8 楼的 https://llm2014.github.io/llm_benchmark 就是 toyama nao 的网站。个人感觉比较准确。
    JerryZhi
        36
    JerryZhi  
       22h 40m ago
    目前普遍思路是采集十几个排行榜求平均(或者加权)
    cellsyx
        37
    cellsyx  
       22h 24m ago
    比较符合个人体验的是 DeepSWE (不包括前端设计能力)
    FlashEcho
        38
    FlashEcho  
       21h 58m ago
    根据使用场景来的,如果你的需求只是和模型聊聊天,当成高级版豆包,那 Arena AI 其实最准
    Glauben
        39
    Glauben  
       21h 14m ago
    我有一个疑问,5.6SOL codex 明明是 258K272K ,为什么这些排行榜上都是 1.1M
    Mandelo
        40
    Mandelo  
       20h 30m ago
    没一个权威的,或者说测试的东西和你工作用用到的完全不是一个东西。
    mingtdlb
        41
    mingtdlb  
       19h 12m ago
    arena 的 side-by-side 不是一样可以选哪个更好,但这个结果是否参与排名不懂得,如果参与,那就可以刷了。。。

    我认为实际还是要自己测试,给一个任务,看哪个模型做的最合你意。排行榜随便看一个就行,一般都相差不会太多,比如 ds 在排行榜 1 是第十,在排行榜 2 就不会跑到第 30 去
    NQ
        42
    NQ  
       16h 22m ago
    那种修开源项目 PR 的可以看看,好歹能测出来一点工程能力,纯聊天或者写玩具项目的就算了。
    crackidz
        43
    crackidz  
       10h 26m ago
    这几个都不准,基本上看看差不多

    DeepSWE 相对比准一点点,但是不是全部

    大模型的评测现在仍旧是一个复杂的评测过程,我建议你看的时候需要根据不同的能力:比如逻辑推理能力、代码编写能力、写作能力等分开进行对比。这些每一个侧重点都不一样,在不同场景会影响大模型在总体中的排名
    crackidz
        44
    crackidz  
       10h 24m ago
    @OumaeKumiko 这个其实算是比较准的了,虽然实际体感略有出入,但不会很大:比如两个模型只差小几分或者零点几分,可能体感不太能区分出来
    gdm
        45
    gdm  
       9h 21m ago
    arena 对美国豆包、开源模型模型经常过度高估,有各种情感分数
    gemini-3.6-flash 蠢炸了,给他写代码经常会导致我的 python 项目甚至点 main.py 直接报错,排名竟然还高于 gpt-5.5-xhigh ,但我用主流模型包括 gpt claude glm ds 这些都不会遇到这种问题,顶多写得烂一点,一些边界处理不好,这种问题我只在新加坡那个免费玩具 agnes-2.5-flash 遇到过
    这排名甚至认为 gemini-3.5-flash-medium 都比 gpt-5.5-high 强,太可笑
    还有他认为 deepseek-v4-flash-high 强于 claude-opus-4-8-thinking ,这点也是相当抽象的,ds 性价比很高,但写的代码质量还是不如 opus 4.8 的,这点我让二者同时写过一样的东西,然后交给 grok gemini 和 gpt 三家审查,结果都是 opus 的更好
    vopsoft
        46
    vopsoft  
       7h 59m ago
    排名纯属扯淡 能全面超过 Opus 4.6 一个都没有 ,也不用看上下文声称多长 我自的病例跨越 2 年 中间问多次 上传过多份检查结果,它都能很好的总结记录 医学知识也很专业 。要光看代码 grok 在解决个别问题时也会偶尔强过它
    cowcomic
        47
    cowcomic  
       7h 52m ago
    @ybybwdwd 还能这样😮
    我自己是常年用 arena ,贡献了不少评分,还挺喜欢这个平台的
    paparaji
        48
    paparaji  
       7h 42m ago
    用户评论最权威
    tangguo
        49
    tangguo  
       7h 34m ago
    其实看这些都没用,我自测目前最强模型还是 4.6 ,或者刚出时候的 fable5
    haoyunyinglai
        50
    haoyunyinglai  
       6h 34m ago
    到达目的地不一定非得开法拉利,五菱也行
    suyuyu
        51
    suyuyu  
       6h 33m ago
    朝产风味跑分模型,跑分没输过
    LovingYoung
        52
    LovingYoung  
       4h 27m ago
    DeepSWE 和 livebench 体感差不多
    cbythe434
        53
    cbythe434  
       2h 53m ago
    和汽车圈一个味了
    wzw
        54
    wzw  
       2h 36m ago
    @vopsoft @tangguo 写代码 现在还是 opus-4.6 好? 比 opus-5/gpt-5.6 sol 还好?
    greygoo
        55
    greygoo  
       2h 11m ago
    qwen3.8 太贵了相比较套餐里面的 gpt-5.6 sol,
    tangguo
        56
    tangguo  
       1h 56m ago
    @wzw 4.6 注意力集中,主要还是看个人了,5.6sol 不建议用,GPT 拉出来跑分用的,opus5 也有点那味
    techmale
        57
    techmale  
       29 mins ago
    首先排除 ARENA.ai
    wzw
        58
    wzw  
       24 mins ago
    @tangguo #56 现在都看不到 4.6 了, opus 4.6 max 我是用了好一段时间,

    看评测都是 opus 5 >>> opus 4.6 了
    lucays
        59
    lucays  
       21 mins ago
    @Glauben 不在 codex 里的 5.6 可以是 1M ,比如 github copilot 有 1M 的 5.6 sol ,但并不代表实际表现更好。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   5135 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 140ms · UTC 09:19 · PVG 17:19 · LAX 02:19 · JFK 05:19
    ♥ Do have faith in what you're doing.