• 请不要在回答技术问题时复制粘贴 AI 生成的内容
qwzhang01
V2EX  ›  程序员

做模型训练、蒸馏门槛高吗

  •  
  •   qwzhang01 · 19h 37m ago · 3072 views

    想知道小模型训练、蒸馏、微调门槛高吗? 端侧模型的训练、微调、蒸馏门槛高吗? 端侧模型在推理上现在最大的障碍是什么呢?

    简单描述一个我的判断,针对很对垂直细分领域的模型训练、微调、蒸馏,以及端侧模型的推理应该会有很多真实场景。

    也就是说,对于一个业务主导的团队,怎么在没有专业模型训练方面的沉淀,就可以快速上手做自己的小模型。 如果从技术上能打通这个环节,会不会能踩中未来的一个方向呢?

    26 replies  •  2026-10-09 16:28:56 +08:00
    zhouhuade
        1
    zhouhuade  
       19h 34m ago
    运行在端侧的门槛是端侧的算力吧
    justNoBody
        2
    justNoBody  
       19h 34m ago
    这玩意儿就像 java ,一开始容易,越做越难
    qwzhang01
        3
    qwzhang01  
    OP
       19h 25m ago
    @zhouhuade 刚刚 Claude 了下,回复端侧最大的障碍是内存和发热,GPU 已经够用
    qwzhang01
        4
    qwzhang01  
    OP
       19h 24m ago
    @justNoBody 如果有门槛,那就可以做做试试喽,万一中了就不用担心下一阶段的工作了 -_-
    qwzhang01
        5
    qwzhang01  
    OP
       19h 21m ago
    现在都在做 agent ,做 tool 治理,做 memory ,做沙箱,RAG,这些技术适合现有的软件工程范式出来的同学。
    如果把这些能力打包成一个个垂直的小模型,会不会现在研究的很多 memory 的技术就不需要了呢?
    纯粹脑暴,最近想创业快想疯了,想找切入点-_-
    Haku
        6
    Haku  
       19h 16m ago
    算力费用高,而且难,很多地方难以量化效果。
    算力是最大的门槛,蒸馏的话,如果是参数蒸馏那一个大模型跑起来当专家模型就会要了算力的命,就算是通过 API 形式做 SFT 后训练,token 费用也是个人难以负担得起的开销。
    XuDongJianSama
        7
    XuDongJianSama  
       18h 51m ago   ❤️ 1
    不要端侧,真好用的话不就被偷了吗。就算自己训练,也租服务器走云端。成本问题的话,如果能力够强成本就不是问题。如果能力不行成本再低也没人用
    catinsides
        8
    catinsides  
       18h 51m ago
    以后大模型上下文长度会越来越大,如果把垂直领域的知识都当做系统提示词一开始就放到上下文中,是不是也不需要做微调了
    Jinnrry
        9
    Jinnrry  
       18h 6m ago via iPhone
    gpu 已经够用了???你特码在逗我?你连内存和发热问题都不知道,你敢说你 gpu 够用了?你不会以为有两张 5090 就能开始蒸馏训练了吧?
    clemente
        10
    clemente  
       17h 41m ago
    是推理部署技术栈和资源需求的 3 倍以上

    因为反向算子+前向算子+分布式通信库 的算子数 是推理的三倍 这是数字上的对比
    clemente
        11
    clemente  
       17h 41m ago
    蒸馏其实就是扫 qa 数据然后做后训练
    clemente
        12
    clemente  
       17h 40m ago
    gpu 也是推理一个同规模模型需求的三倍以上
    clemente
        13
    clemente  
       17h 40m ago
    @clemente 错了 应该是十几倍
    因为推理的模型都是量化的
    训练需要回到 bf16
    COW
        14
    COW  
       17h 38m ago
    不训练,直接下载现成的,等出新的了再下载,就跟客户说更新版本了
    zhangli2946
        15
    zhangli2946  
       17h 38m ago
    一如 自建机房和购买云服务
    clemente
        16
    clemente  
       17h 34m ago
    1. 模型训练包含前向算子、反向算子以及分布式通信开销,算子数量是推理的 3 倍以上,对应的技术栈与资源需求也高于推理部署。
    2. 工程落地里很多蒸馏方案,本质就是遍历 高质量的领先模型的问题回答数据,对基模做后训练。
    3. 同规模模型训练所需 GPU 资源远超推理。通常要 8 卡 x16 集群来训练
    4. 修正:实际差距可达十几倍。因为线上推理普遍使用量化模型,而训练需要维持 BF16 精度。
    scegg
        17
    scegg  
       17h 30m ago
    先去电脑城看看现在硬件,尤其是显卡的价格,就知道 GPU 是不是够用。
    coefu
        18
    coefu  
       17h 18m ago
    "简单描述一个我的判断,针对很对垂直细分领域的模型训练、微调、蒸馏,以及端侧模型的推理应该会有很多真实场景。"

    你这个判断不成立,over 。

    你先搞清楚参数和智能的关系先,在 ANN 基础上的泛 transformer/mamba 架构,都是一份参数一份智能。端侧参数少,有个毛的场景,你不会以为像 shell 的命令 拼出 shell 脚本 一样,能把多个小参数 搭积木搭出大效果?不存在的。
    plasticee
        19
    plasticee  
       17h 6m ago
    @qwzhang01 ai 现在有哪些沙箱?
    xiaohuangya
        20
    xiaohuangya  
       16h 35m ago
    小模型的微调、训练并不难,但是没有办法做到比现有的模型效果更好,这点很重要,在这种情况下很难有客户买单。除非只是自己业务上用,简单的业务用小模型来进行处理,复杂的业务小模型就是没办法。
    iyaozhen
        21
    iyaozhen  
       16h 22m ago
    "会不会能踩中未来的一个方向呢" 你要是这个目的感觉有点难,你这啥也不知道,纯脑补呀
    NullIsLife
        22
    NullIsLife  
    PRO
       15h 51m ago
    用大模型能解决你的问题吗,如果不能 小模型应该也解决不了
    如果能解决,训练小模型 + 部署推理,成本也不低,如果你量不大可能更贵
    wersero
        23
    wersero  
       15h 50m ago
    有 ai 的帮助,其实还好吧
    zhanying
        24
    zhanying  
       15h 14m ago
    当你问出这个问题的时候,就已经很难了。。。
    dacapoday
        25
    dacapoday  
       14h 34m ago
    应该挺高的, 腾讯换人后, 混元跑分就上来了. 换上的是来自 openAI 的人才, 淘汰的是本土瞎琢磨的.
    jtjing
        26
    jtjing  
       14h 13m ago
    如果是做蒸馏感觉成本比较低,我自己通过蒸馏的方式训练了一个浏览器能够运行的小模型,然后产品化了。
    https://sunp.eu.org/t/1244719?p=1#reply13 可以看看我的这个帖子。

    训练环境: 阿里云租了一个 gpu 显卡,然后准备了不到百万条数据。总花费不到 100 元。
    因为你不是从头训练一个模型,肯定是基于一个小模型开始训练,所以收敛速度非常快的。不需要海量的数据。

    可以跳到我帖子里面的产品试用一下,效果还是可以的。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   1016 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 52ms · UTC 22:42 · PVG 06:42 · LAX 15:42 · JFK 18:42
    ♥ Do have faith in what you're doing.