LLM 系列课程

从一句话进入模型,到亲手训练与部署

这是一条从直觉到实践的 LLM 学习路线。每一课只回答一个核心问题,尽量用简单的例子把概念讲清楚;已发布的课程可以直接点击阅读。

24节课程
4个学习阶段
7篇已发布
01

建立整体认识

先看懂模型怎样工作,再理解一次训练怎样发生。

02

拆开 Transformer

进入模型内部,理解关键组件为什么这样设计。

09

一个 Transformer Block 内部到底有什么?

计划中
10

Residual、LayerNorm 和 RMSNorm 为什么重要?

计划中
11

位置编码:模型如何知道 Token 的顺序?

计划中
12

RoPE 是怎样把位置信息放进 Attention 的?

计划中
13

MHA、MQA、GQA 和 MLA 有什么区别?

计划中
14

FFN、SwiGLU 与模型的“知识存储”

计划中
15

MoE:为什么只激活一部分专家?

计划中
16

FlashAttention 为什么更快、更省显存?

计划中
03

理解推理与部署

从生成策略到推理加速,看懂模型在线上怎样运行。

17

Temperature、Top-K、Top-P 怎样改变生成结果?

计划中
18

KV Cache 为什么能加速逐 Token 生成?

计划中
19

Prefill 与 Decode:推理为什么分成两个阶段?

计划中
20

量化:INT8、INT4 到底损失了什么?

计划中
04

微调、对齐与项目

把前面的知识连起来,完成一次可以落地的模型实践。

21

SFT:怎样把基础模型训练成聊天助手?

计划中
22

LoRA 与 QLoRA:普通显卡怎样微调模型?

计划中
23

RLHF、DPO 与偏好对齐到底在做什么?

计划中
24

终期项目:训练、评估并部署一个小型语言模型

计划中

课程会按学习进度持续更新。发布新课后,这一页会同步补上阅读链接。