qdwang

我觉得目前小模型的训练方向都跑偏了

  •  1
     
  •   qdwang · 1 day ago · 1028 views

    小模型(<10B 的模型)都学着 qwen 去卷 agentic 了。但是编程的人,总会用更大的模型来达到高效率。

    反而小模型应该深耕的语言方向,移动端对话方向,都荒废了。

    测了近 10 个最新的小模型,只有 Gemma4 E4B 能做好我需求的特定模版下的翻译加分析句子任务。

    一个个 benchmark 分数越来越高,却都忽略了最原本的语言能力。

    5 replies  •  2026-09-26 20:46:22 +08:00
    Yuk1Nooo
        1
    Yuk1Nooo  
       1 day ago
    我觉得 op 在一定程度上有点倒果为因了,因为小模型也都是用更大的模型当教师模型训/蒸馏出来的。不过当前确实存在如 op 所说的问题。
    yexiaoqi
        2
    yexiaoqi  
       1 day ago
    大模型还没内卷到一定的高度,小模型方向就不会定型吧
    qdwang
        3
    qdwang  
    OP
       13h 12m ago
    @Yuk1Nooo 嗯嗯
    cccn
        4
    cccn  
       4h 31m ago
    顺便问下。哪个小模型的英文教学能力比较强
    qdwang
        5
    qdwang  
    OP
       3h 32m ago
    @cccn 我测下来,语言方面 10B 以下的,应该 E4B 是第一了。有条件的话,你可以试试 K2-Horizon-7B ,这个应该更强,但是官方版 llama.cpp 还没支持,所以我还没测过。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   1523 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 23ms · UTC 16:18 · PVG 00:18 · LAX 09:18 · JFK 12:18
    ♥ Do have faith in what you're doing.