siriusliangcn
0.01D
0.01D
V2EX  ›  OpenAI

据说 GPT6 的技术路线,可以压榨出十几倍的参数效果

  •  
  •   siriusliangcn · 1 day ago · 2205 views

    OpenAI 证明此路可行,那等几个月被开源模型们摸索清楚了,那岂不是本地 27b 的模型能跑出 300b 模型的效果?哪怕 12b 能出 100b 的效果也行啊!

    要 token 自由了?

    是不是可以 Mac Studio 买起来了……

    8 replies    2026-09-04 16:55:11 +08:00
    zhanying
        1
    zhanying  
       1 day ago
    不太相信,截止目前,“没有银弹”还是真理。。。
    sentinelK
        2
    sentinelK  
       1 day ago   ❤️ 1
    你如果只看跑分的话,qwen3.8-27B 的 xhigh 跑分,也可以和 flash-0731 有来有回。甚至吊打上 T 规模的老模型。

    但是这是春秋笔法,没意义。
    cubecube
        3
    cubecube  
       1 day ago
    @sentinelK 有意义啊,3.8flash 很好用
    shitshit666
        4
    shitshit666  
       1 day ago
    @sentinelK 但是跑分的话,好像也是模拟日常使用
    coefu
        5
    coefu  
       1 day ago
    要是真行,全世界都不要新建 idc 了,openai 又找 amd 订了卡。

    当前 transformer 架构下,scaling law 依然有效。

    存算一体没有搞成之前,冯诺伊曼体系下,只有堆量,物理规律决定的。
    sentinelK
        6
    sentinelK  
       1 day ago
    @shitshit666 没错,但是很多维度的体验是跑分没法告诉你的。

    比如更小体量的模型,因为缺知识量,所以直觉更差,就需要更多的重试次数。
    比如为了能力更好,越小的模型性格越偏激,必须要拿到真凭实据(收敛到极致),导致 thinking 起来完全停不下来。
    longaiwp
        7
    longaiwp  
       1 day ago
    @sentinelK 这不就是跑分没有告诉你的事情,又不是跑分的设计有问题,你需要另外一个跑分衡量你想要的标准。
    zizon
        8
    zizon  
       6h 46m ago
    理论上,递归比循环省代码.
    循环比手动展开省代码.

    但这和要不要能不能写手工展开循环代码没冲突.
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2654 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 49ms · UTC 15:42 · PVG 23:42 · LAX 08:42 · JFK 11:42
    ♥ Do have faith in what you're doing.