多模态学习课程
从图片进入 Transformer,到图文理解与视频实践
接着 LLM 课程,学习模型怎样处理图片、连接语言,再理解视频。每一课从一个具体问题出发,用直觉、公式和代码把过程讲清楚。
12周学习路线
1篇已发布
ViT从第一课开始
01
视觉基础
第 1–2 周:图片怎样变成向量,视觉编码器怎样学习表示。
01
ViT:图片是怎么变成 Token 的?
已发布 · 阅读课程02
Vision Encoder:不同训练目标怎样塑造视觉表示?
计划中02
图文对齐
第 3–4 周:CLIP、对比学习与 SigLIP,图片和文字如何比较。
03
视觉连接语言
第 5–7 周:Projector、Q-Former、LLaVA 与 Qwen-VL,视觉信息怎样进入 LLM。
04
图像与视频理解
第 8–10 周:OCR、定位、分辨率与时间关系,从单张图片走向视频。
05
多模态实践
第 11–12 周:多模态 Agent 与游戏视频分析,建立数据、证据和评估闭环。
课程持续更新。已发布的文章可以直接点击,后续主题将随学习进度展开。