12 周多模态视觉智能自主学习课程¶
这是一条面向高年级本科生与研究生新手的自主学习路径。课程以多模态文档理解为当前训练主线,同时为图像、视频和更广泛的视觉智能研究建立共同基础。
从 Week 1 开始 查看完整 12 周路线 打开自主评估指南
学习方式
每周建议投入约 24 小时:完成一条可复现主线,再从给出的方向中选择一个自主探索。学生自己判断证据是否充分;导师只在每周例会听取进展、困难和下一步,不评分、不验收。
12 周能力路线¶
| 阶段 | 周次 | 核心能力 | 阶段成果 |
|---|---|---|---|
| Reproducible Builder | Week 1–3 | Git、模型调用、AI 辅助编程与验证 | 可复现脚本、PR、测试与 AI 使用记录 |
| Document AI Explorer | Week 4–7 | VLM、文档解析、Dataset 与 Benchmark | Pipeline、固定测试集与 baseline |
| Model Experimenter | Week 8–10 | LoRA/PEFT、W&B、统一评测与消融 | 可比较 runs、Report 与错误分析 |
| Research Communicator | Week 11–12 | 论文复现、项目表达与自主答辩 | Reproduction report 与 Capstone |
每周怎样学习¶
先选择适合你的路径¶
| 路径 | 每周投入 | 适合情况 | 完成边界 |
|---|---|---|---|
| 最小路径 | 8–12 小时 | 初次接触、普通电脑或免费云资源 | 完成本周最小动作,留下可复现的核心证据 |
| 标准路径 | 约 24 小时 | 希望系统完成课程主线 | 完成主线、验证、一次探索和复盘 |
| 进阶路径 | 24 小时以上 | 已有基础或具备更多算力 | 在标准路径上增加论文复现、消融或更完整评测 |
三条路径使用相同的研究问题和证据标准,区别只在任务范围与实验规模。算力不足时缩小模型、数据和训练步数,不省略版本、输出、失败案例与解释。
- 4 小时|理解:只读本周任务直接需要的课程说明和官方材料。
- 10 小时|建设:把代码、数据或模型能力加入贯穿 12 周的同一个项目。
- 4 小时|验证:保存配置、原始输出、指标、测试和失败案例。
- 4 小时|探索:从工程、模型、数据、评测或未来视频方向中选择一个继续追问。
- 2 小时|复盘:更新学习记录、自主评估并准备例会进展。
所有周次遵循同一闭环:
Learn → Run → Measure → Improve → Explain
你将获得什么¶
完成课程后,你应能:
- 用 GitHub 管理一个可复现的 AI 研究项目;
- 透明使用 AI-assisted coding,并验证 AI 生成代码;
- 调用 Vision-Language Model 处理真实图像和文档;
- 构建 PDF → 结构化数据的 Document AI Pipeline;
- 设计固定测试集、baseline、指标和 error analysis;
- 用 LoRA/PEFT 完成一次小规模微调;
- 用 W&B 记录、比较和解释实验;
- 阅读论文并复现一个最小主张;
- 完成一个可复现、可评测、能说明限制的研究作品。
自主学习不是独自摸索¶
每周页面都会明确提供:
- 一个核心问题;
- 16–18 小时的主线任务;
- 必须留下的研究证据;
- 三个左右的自主探索方向;
- 一组自主检查问题;
- 例会前应准备的进展摘要;
- 直接相关的官方学习入口。
完成主线后只选一个方向深入。若证据仍不完整,应先补齐复现记录和失败分析,而不是盲目增加模型、数据或工具。
开始前¶
- 打开12 周路线,阅读自主学习规则和 Week 1。
- 根据自主评估与证据指南创建个人学习仓库。
- 复制学习记录模板,从第一周开始记录选择与证据。
- 每周例会前准备“完成了什么、证据在哪里、最大困难、探索方向和下一步”。
模块学习卡
学什么:可复现研究、Document AI pipeline、模型实验与研究表达。
官方来源:每周末尾列出的官方文档、论文、Model Card 与 Dataset Card。
做什么:按所选路径完成本周最小动作或完整主线。
提交什么:代码、配置、原始输出、失败案例和简短复盘。
如何自查:使用每周自查清单和自主评估指南。
设备不足也能继续
Week 1–7 可以使用普通电脑或小规模云端环境。Week 8–10 可使用 Kaggle/Colab、小模型、小数据或更短训练。自主检查关注问题、方法、证据和解释,不比较 GPU 时长或模型规模。
快速入口¶
| 当前需要 | 入口 |
|---|---|
| 查看每周任务和探索方向 | 12 周路线 |
| 判断成果处于哪个阶段 | 自主评估指南 |
| 记录实验、AI 协作和例会准备 | 学习记录模板 |
| 解决常见问题 | FAQ |
| 补充研究背景 | 论文导读 |
| 跑通一个短时案例 | 动手教程 |
| 完成端到端作品 | 项目实战 |
按当前需要选择专题¶
| 当前需要 | 推荐专题 | 专题最小耗时 | GPU | 完成后去向 |
|---|---|---|---|---|
| 建立可审查仓库 | Git 与 GitHub | 1–2 小时 | 不需要 | Python 环境 |
| 建立可重建环境 | Python 环境 | 1–2 小时 | 不需要 | Hugging Face / Transformers |
| 选择并记录模型或数据 | Hugging Face Hub | 1–2 小时 | 不需要 | Transformers 推理 |
| 使用免费云端环境 | Kaggle Notebook | 约 1 小时 | 按任务启用 | 对应教程或课程周次 |
| 完成首次可复现推理 | Transformers | 1–2 小时 | 小模型可不需要 | VLM 专题 |
| 安全使用 AI 编程助手 | AI 辅助编程 | 2–3 小时 | 不需要 | Week 3 证据整理 |
| 完成一次轻量 VLM 推理 | Qwen3.5-0.8B | 2–3 小时 | 可选 | Week 4 受控实验 |
| 把 PDF 转为结构化结果 | Docling | 2–3 小时 | 通常不需要 | Document AI 与评测 |
| 规划小规模微调 | 后训练与 W&B | 先用 1 小时规划 | 执行阶段通常需要 | Week 8–10 评测与消融 |
专题最小耗时只覆盖页面中的最小动作,不等于对应 Week 的完整投入。进入页面后先选择最小、标准或进阶范围,再按运行契约准备环境。