 |
|
clemente
🏢 leftrightmovehands
V2EX member #455659, joined on 2019-11-26 18:13:05 +08:00
|
cachemineshot
 |
Per clemente's settings, the topics list is hidden |
Deals info, including closed deals, is not hidden
clemente's recent replies
1. 模型训练包含前向算子、反向算子以及分布式通信开销,算子数量是推理的 3 倍以上,对应的技术栈与资源需求也高于推理部署。
2. 工程落地里很多蒸馏方案,本质就是遍历 高质量的领先模型的问题回答数据,对基模做后训练。
3. 同规模模型训练所需 GPU 资源远超推理。通常要 8 卡 x16 集群来训练
4. 修正:实际差距可达十几倍。因为线上推理普遍使用量化模型,而训练需要维持 BF16 精度。
@
clemente 错了 应该是十几倍
因为推理的模型都是量化的
训练需要回到 bf16
是推理部署技术栈和资源需求的 3 倍以上
因为反向算子+前向算子+分布式通信库 的算子数 是推理的三倍 这是数字上的对比
g 家的人才密度 不是搞这块的料
组织结构才是最关键的