OpenAI 证明此路可行,那等几个月被开源模型们摸索清楚了,那岂不是本地 27b 的模型能跑出 300b 模型的效果?哪怕 12b 能出 100b 的效果也行啊!
要 token 自由了?
是不是可以 Mac Studio 买起来了……
OpenAI 证明此路可行,那等几个月被开源模型们摸索清楚了,那岂不是本地 27b 的模型能跑出 300b 模型的效果?哪怕 12b 能出 100b 的效果也行啊!
要 token 自由了?
是不是可以 Mac Studio 买起来了……
1
zhanying 1 day ago
不太相信,截止目前,“没有银弹”还是真理。。。
|
2
sentinelK 1 day ago 你如果只看跑分的话,qwen3.8-27B 的 xhigh 跑分,也可以和 flash-0731 有来有回。甚至吊打上 T 规模的老模型。
但是这是春秋笔法,没意义。 |
4
shitshit666 1 day ago
@sentinelK 但是跑分的话,好像也是模拟日常使用
|
5
coefu 1 day ago
要是真行,全世界都不要新建 idc 了,openai 又找 amd 订了卡。
当前 transformer 架构下,scaling law 依然有效。 存算一体没有搞成之前,冯诺伊曼体系下,只有堆量,物理规律决定的。 |
6
sentinelK 1 day ago
@shitshit666 没错,但是很多维度的体验是跑分没法告诉你的。
比如更小体量的模型,因为缺知识量,所以直觉更差,就需要更多的重试次数。 比如为了能力更好,越小的模型性格越偏激,必须要拿到真凭实据(收敛到极致),导致 thinking 起来完全停不下来。 |
8
zizon 6h 46m ago
理论上,递归比循环省代码.
循环比手动展开省代码. 但这和要不要能不能写手工展开循环代码没冲突. |