LLM 系列课程
从一句话进入模型,到亲手训练与部署
这是一条从直觉到实践的 LLM 学习路线。每一课只回答一个核心问题,尽量用简单的例子把概念讲清楚;已发布的课程可以直接点击阅读。
24节课程
4个学习阶段
7篇已发布
01
建立整体认识
先看懂模型怎样工作,再理解一次训练怎样发生。
02
拆开 Transformer
进入模型内部,理解关键组件为什么这样设计。
09
一个 Transformer Block 内部到底有什么?
计划中10
Residual、LayerNorm 和 RMSNorm 为什么重要?
计划中11
位置编码:模型如何知道 Token 的顺序?
计划中12
RoPE 是怎样把位置信息放进 Attention 的?
计划中13
MHA、MQA、GQA 和 MLA 有什么区别?
计划中14
FFN、SwiGLU 与模型的“知识存储”
计划中15
MoE:为什么只激活一部分专家?
计划中16
FlashAttention 为什么更快、更省显存?
计划中03
理解推理与部署
从生成策略到推理加速,看懂模型在线上怎样运行。
17
Temperature、Top-K、Top-P 怎样改变生成结果?
计划中18
KV Cache 为什么能加速逐 Token 生成?
计划中19
Prefill 与 Decode:推理为什么分成两个阶段?
计划中20
量化:INT8、INT4 到底损失了什么?
计划中04
微调、对齐与项目
把前面的知识连起来,完成一次可以落地的模型实践。
21
SFT:怎样把基础模型训练成聊天助手?
计划中22
LoRA 与 QLoRA:普通显卡怎样微调模型?
计划中23
RLHF、DPO 与偏好对齐到底在做什么?
计划中24
终期项目:训练、评估并部署一个小型语言模型
计划中课程会按学习进度持续更新。发布新课后,这一页会同步补上阅读链接。