光看榜单感觉也不是很靠谱。
1
alanying OP 其实是 Qwen3.8 > GLM5.2 > K3 > DPSKv4 Pro 的但是标题写 Qwen3.8 怕被喷
|
2
shintendo 4h 39m ago
GLM5.2 > K3 是认真的吗
|
3
foryou2023 4h 34m ago
估计得重新测试了,官网刚刚才更新了更新日志,就是官方的 harness 还不发布,不知道啥时候发布。
|
4
shintendo 4h 31m ago
@foryou2023 说是明天
|
5
Miaoz 3h 40m ago GLM5.2 > K3 认真的吗 +1
|
6
jackerbauer 2h 52m ago
主观太强
|
7
jackerbauer 2h 51m ago
不过 GLM5.2 > K3 ,确实离谱
|
8
cue 2h 48m ago via iPhone
你们部门……是千问团队吗……
|
9
Qmanman 2h 47m ago via Android
glm5.2 不太行
|
10
isbase PRO 据说模型上错了 再用目前的版本试试
|
11
alanying OP |
13
bowen628 57 mins ago
官方 harness 已经发了,包名 @deepseek-ai/dsh ,这轮盲测可以顺手重跑一次。模型横评不固定壳,工具 schema 、prompt 拼法、上下文回放全会混进分数,最后测的其实是 model+harness 。利益相关:我参与 BitFun ,我们这边一直把 prompt 做成字节级稳定,SWE-Bench-Pro 那轮 KV cache 平均命中 98.67%;拿同一仓库在 DSH / BitFun 交叉跑,应该比只看榜单有意思。
|
14
Tink 56 mins ago
测试方法是啥啊?
|
15
exhades 51 mins ago
GLM5.2 是什么路边,我这边都是 K3 > qwen3.8max > dsv4Pro > GLM5.2
|
16
cowcomic 41 mins ago
据说已经下架了
|