FP32、FP16、BF16 和混合精度有什么区别?
位数变少为什么更快,又为什么可能让训练崩掉
目录第七课目录1、浮点数结构2、三种格式3、为什么更快4、FP16 风险5、混合精度6、为什么常用 BF16格式对比复习总图
继续阅读 →
生活是一个过程
位数变少为什么更快,又为什么可能让训练崩掉
Attention 交流之后,每个 Token 怎样被非线性加工
从原始文本到 Batch,看懂大模型的数据流水线
从训练样本、交叉熵到反向传播,看懂一次完整训练
从 Q、K、V 到上下文表示,拆解一次注意力计算
从文字到回答,拆解一次完整的预测过程