qdwang

我觉得目前小模型的训练方向都跑偏了

  •  1
     
  •   qdwang · 2 days ago · 1482 views

    小模型(<10B 的模型)都学着 qwen 去卷 agentic 了。但是编程的人,总会用更大的模型来达到高效率。

    反而小模型应该深耕的语言方向,移动端对话方向,都荒废了。

    测了近 10 个最新的小模型,只有 Gemma4 E4B 能做好我需求的特定模版下的翻译加分析句子任务。

    一个个 benchmark 分数越来越高,却都忽略了最原本的语言能力。

    6 replies  •  2026-09-27 14:10:40 +08:00
    Yuk1Nooo
        1
    Yuk1Nooo  
       2 days ago
    我觉得 op 在一定程度上有点倒果为因了,因为小模型也都是用更大的模型当教师模型训/蒸馏出来的。不过当前确实存在如 op 所说的问题。
    yexiaoqi
        2
    yexiaoqi  
       2 days ago
    大模型还没内卷到一定的高度,小模型方向就不会定型吧
    qdwang
        3
    qdwang  
    OP
       1 day ago
    @Yuk1Nooo 嗯嗯
    cccn
        4
    cccn  
       1 day ago
    顺便问下。哪个小模型的英文教学能力比较强
    qdwang
        5
    qdwang  
    OP
       1 day ago   ❤️ 1
    @cccn 我测下来,语言方面 10B 以下的,应该 E4B 是第一了。有条件的话,你可以试试 K2-Horizon-7B ,这个应该更强,但是官方版 llama.cpp 还没支持,所以我还没测过。
    mjar
        6
    mjar  
       17h 47m ago via iPhone
    我猜也许真正在用的小模型没必要公开,而真正关注开源小模型的人大多数是程序员?看 hackernews ,每次小模型发布,热评必定有“我拿它跑了 agent 来生成本地代码,不比前沿模型差,amazing”
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   1178 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 43ms · UTC 23:57 · PVG 07:57 · LAX 16:57 · JFK 19:57
    ♥ Do have faith in what you're doing.