Qwen3.8-max 出了,今天看排行榜 3 个榜 3 个名次,该信哪个呢?
Qwen3.8-max 出了,今天看排行榜 3 个榜 3 个名次,该信哪个呢?
1
vzextreme 1 day ago
看厂商对哪家测评机构特调🐶
|
3
cowcomic 1 day ago
arena 是匿名对比得分,这类稍微更偏向普通人的感官,我个人比较倾向这种竞技场排行的
其他数据集评测的主要还是看测试数据分布和泄露情况了 中文也有榜单 https://www.superclueai.com/homepage |
4
tcper 1 day ago 看评分标准,
arena 就是通过匿名选择喜好,体现用户体验 llm-stats 是多个评分集的聚合 AA 自建评测集,这些集体现大模型对未知问题的推理能力 不过客观来说,llm-stats 的聚合更能体现全面成绩,因为就算刷烂的题目成绩很好也不错了,起码能覆盖日常遇到的问题,并不是大模型都要去解决未知问题。 |
5
lel020 1 day ago
牛马 agent 使用还是得看社区评价,什么跑分都靠不住,
|
6
Bootis 1 day ago
arena 都是 one shot 提示词任务,大型工程的复杂任务能力看这个榜单参考价值不大
|
8
opeth 1 day ago
我基本上就看 artificial analysis 和最强野榜 https://llm2014.github.io/llm_benchmark
|
9
wang93wei 1 day ago
我个人觉得 DeepSWE 这个更权威一些。https://deepswe.datacurve.ai/
|
10
klion 1 day ago https://artificialanalysis.ai/leaderboards/models 里面重点关注这几个指标就知道,这些才是真正的模型智能
Terminal-Bench Hard AA-Omniscience Accuracy Humanity’s Last Exam GPQA Diamond |
11
xiaoxixi 1 day ago
好多排行站,之前都没关注过
|
12
soulflysimple123 1 day ago
看 https://artificialanalysis.ai/
我看 Qwen3.8-max 里面还没有 |
13
sillydaddy 1 day ago
我目前只看 arena ,它是基于两两比赛得到的,裁判是广大用户。
|
14
rich1e 1 day ago
排行榜上的权威与真实体验,一些情况下并不相符合
就像,在国产模型上使用 CC ,编程体验也还不错,但是遇到一些特定场景(视频分析 / 复杂逻辑推理),可能就不能工作 - 视频分析时,可能会用到 claude vision - 复杂逻辑推理,会触发多个模型之间并行工作( Opus / Haiku / Sonnet ) 以上这些,如果模型没有适配,CC 就无法工作 所以,大模型排行榜看看就好,权威也改变不了真实体验 推荐这个,https://x.com/karpathy/status/2083749667410727319 |
15
nakun233 1 day ago
当然是 DeepSWE 1.1
|
16
kuhung 1 day ago
我个人还关心价格,即性价比。到了当前阶段,模型提升带来的体验上升已经很难如年初 opus4.6 那样了。我自己写了一个 https://www.traktoken.com/ 用来比价。此外,开发过程中还发现国外金融机构在观测 token 支出指数,用来指导投资,所以复现了一个 https://www.traktoken.com/spend-index 。从落地页来看,后者目前占一半的流量。
|
17
sxbaixing 1 day ago
千问向来是跑分高,体验差
|
18
mmdsun 1 day ago via iPhone
论知名度还是 arena 靠谱
|
19
OumaeKumiko 1 day ago
竟然还没有人发东山奈央的😂 俺也不知道是否权威
[toyama nao - 知乎]( https://www.zhihu.com/people/toyama) |
20
uncleroot 1 day ago
不知道有没有各种语言的“人味”排行。机器味太重了
|
21
wakarimasen 1 day ago via Android
权威这两个字令人困惑。
如果你要权威数据应该看厂商发布的第一方数据 |
22
Wcowin 1 day ago
具体场景具体分析吧,适合自己就是最强的。
|
23
jonsmith 1 day ago
编程方面不看好 Qwen ,跟 Gemini 一样,跑分高、编程能力不行。
|
24
cabudad 1 day ago
什么排行榜都没有自己亲身使用权威,好不好用了才知道
|
25
SeleiXi 1 day ago
让 gpt 找一些比较新+作者比较权威的 benchmark 调研一下,一般比较老或者比较有影响力的早就过拟合过了
|
27
levn 1 day ago
普通人类评价早就已经没用了在大多数时候
|
28
jark006 1 day ago
我比较信 DeepSWE
|
29
Bootis 1 day ago
|
30
escapefear 1 day ago
我奉行对标谁就用谁的原则
|
31
LK996 23h 59m ago
和手机评测一样,都是给够前就上的婊子,没有干净的
|
32
Znemo 23h 47m ago 哪个 Gemini 排名最低相信哪个。
|
33
William337 23h 47m ago
没有,需要自行判断,仅供参考
|
34
Haku 23h 41m ago via Android
arean 是竞技场天梯,分数有保障,但是仅限前端(编程是只有前端)
|
35
aes114514gcm 22h 53m ago
@OumaeKumiko 8 楼的 https://llm2014.github.io/llm_benchmark 就是 toyama nao 的网站。个人感觉比较准确。
|
36
JerryZhi 22h 40m ago
目前普遍思路是采集十几个排行榜求平均(或者加权)
|
37
cellsyx 22h 24m ago
比较符合个人体验的是 DeepSWE (不包括前端设计能力)
|
38
FlashEcho 21h 58m ago
根据使用场景来的,如果你的需求只是和模型聊聊天,当成高级版豆包,那 Arena AI 其实最准
|
39
Glauben 21h 14m ago
我有一个疑问,5.6SOL codex 明明是 258K272K ,为什么这些排行榜上都是 1.1M
|
40
Mandelo 20h 30m ago
没一个权威的,或者说测试的东西和你工作用用到的完全不是一个东西。
|
41
mingtdlb 19h 12m ago
arena 的 side-by-side 不是一样可以选哪个更好,但这个结果是否参与排名不懂得,如果参与,那就可以刷了。。。
我认为实际还是要自己测试,给一个任务,看哪个模型做的最合你意。排行榜随便看一个就行,一般都相差不会太多,比如 ds 在排行榜 1 是第十,在排行榜 2 就不会跑到第 30 去 |
42
NQ 16h 22m ago
那种修开源项目 PR 的可以看看,好歹能测出来一点工程能力,纯聊天或者写玩具项目的就算了。
|
43
crackidz 10h 26m ago
这几个都不准,基本上看看差不多
DeepSWE 相对比准一点点,但是不是全部 大模型的评测现在仍旧是一个复杂的评测过程,我建议你看的时候需要根据不同的能力:比如逻辑推理能力、代码编写能力、写作能力等分开进行对比。这些每一个侧重点都不一样,在不同场景会影响大模型在总体中的排名 |
44
crackidz 10h 24m ago
@OumaeKumiko 这个其实算是比较准的了,虽然实际体感略有出入,但不会很大:比如两个模型只差小几分或者零点几分,可能体感不太能区分出来
|
45
gdm 9h 21m ago
arena 对美国豆包、开源模型模型经常过度高估,有各种情感分数
gemini-3.6-flash 蠢炸了,给他写代码经常会导致我的 python 项目甚至点 main.py 直接报错,排名竟然还高于 gpt-5.5-xhigh ,但我用主流模型包括 gpt claude glm ds 这些都不会遇到这种问题,顶多写得烂一点,一些边界处理不好,这种问题我只在新加坡那个免费玩具 agnes-2.5-flash 遇到过 这排名甚至认为 gemini-3.5-flash-medium 都比 gpt-5.5-high 强,太可笑 还有他认为 deepseek-v4-flash-high 强于 claude-opus-4-8-thinking ,这点也是相当抽象的,ds 性价比很高,但写的代码质量还是不如 opus 4.8 的,这点我让二者同时写过一样的东西,然后交给 grok gemini 和 gpt 三家审查,结果都是 opus 的更好 |
46
vopsoft 7h 59m ago
排名纯属扯淡 能全面超过 Opus 4.6 一个都没有 ,也不用看上下文声称多长 我自的病例跨越 2 年 中间问多次 上传过多份检查结果,它都能很好的总结记录 医学知识也很专业 。要光看代码 grok 在解决个别问题时也会偶尔强过它
|
48
paparaji 7h 42m ago
用户评论最权威
|
49
tangguo 7h 34m ago
其实看这些都没用,我自测目前最强模型还是 4.6 ,或者刚出时候的 fable5
|
50
haoyunyinglai 6h 34m ago
|
51
suyuyu 6h 33m ago
朝产风味跑分模型,跑分没输过
|
52
LovingYoung 4h 27m ago
DeepSWE 和 livebench 体感差不多
|
53
cbythe434 2h 53m ago
和汽车圈一个味了
|
55
greygoo 2h 11m ago
qwen3.8 太贵了相比较套餐里面的 gpt-5.6 sol,
|
59
lucays 21 mins ago
@Glauben 不在 codex 里的 5.6 可以是 1M ,比如 github copilot 有 1M 的 5.6 sol ,但并不代表实际表现更好。
|