多模态学习课程

从图片进入 Transformer,到图文理解与视频实践

接着 LLM 课程,学习模型怎样处理图片、连接语言,再理解视频。每一课从一个具体问题出发,用直觉、公式和代码把过程讲清楚。

12周学习路线
1篇已发布
ViT从第一课开始
01

视觉基础

第 1–2 周:图片怎样变成向量,视觉编码器怎样学习表示。

01

ViT:图片是怎么变成 Token 的?

已发布 · 阅读课程
02

Vision Encoder:不同训练目标怎样塑造视觉表示?

计划中
02

图文对齐

第 3–4 周:CLIP、对比学习与 SigLIP,图片和文字如何比较。

03

视觉连接语言

第 5–7 周:Projector、Q-Former、LLaVA 与 Qwen-VL,视觉信息怎样进入 LLM。

04

图像与视频理解

第 8–10 周:OCR、定位、分辨率与时间关系,从单张图片走向视频。

05

多模态实践

第 11–12 周:多模态 Agent 与游戏视频分析,建立数据、证据和评估闭环。

课程持续更新。已发布的文章可以直接点击,后续主题将随学习进度展开。