📚 Learning Center¶
欢迎进入 Multimodal Vision AI Learning Center 学习中心。
本学习中心面向实验室本科生、硕士生和博士生,目标是帮助学生系统掌握:
- 多模态大模型(Vision Language Models)
- 文档智能(Document AI)
- 视觉人工智能(Vision AI)
- 大模型工程训练与评测实践
- 科研实验方法
本学习路线采用以下模式:
理论学习 + 工程实践 + 科研实验
🎯 学习目标¶
完成 Learning Center 学习后,你应该能够:
✅ 理解多模态视觉大模型基本原理
✅ 掌握 GitHub 科研开发流程
✅ 熟悉 Python / Transformers / Hugging Face
✅ 使用主流 Vision Language Models
✅ 开展 Document AI 实验
✅ 开展 AI 模型后训练(Post Training)实验
✅ 完成 AI 模型测试、评测和分析
✅ 独立开展 AI 科研实验
🗺️ 推荐学习路线¶
建议按照以下顺序学习。
🛠️ Stage 0:掌握必备技能¶
➡️ 官网学习必备技能
🛠️ Stage 1:AI开发基础环境¶
学习人工智能研究必须掌握的基础工具。
Git 与 GitHub¶
学习:
- Git 基础操作
- GitHub代码管理
- 科研项目协作
➡️ Git 与 GitHub
Python 开发环境¶
学习:
- Python环境配置
- Conda管理
- AI开发环境搭建
➡️ Python 开发环境
Hugging Face¶
学习:
- Model Hub
- Dataset Hub
- Transformers生态
➡️ Hugging Face
Kaggle¶
学习:
- GPU Notebook
- 数据分析
- AI实验环境
➡️ Kaggle实践环境
Transformers¶
学习:
- Transformers框架
- 模型加载
- 推理流程
🧠 Stage 2:Foundation Models¶
学习现代人工智能基础模型。
主要内容:
| 内容 | 说明 |
|---|---|
| Vision Language Models | 多模态大模型基础 |
| Qwen-VL | 通用视觉语言模型 |
| Docling | 文档解析模型 |
课程:
📄 Stage 3:Document AI¶
学习多模态文档智能技术。
主要内容:
- 文档理解
- OCR
- 文档解析
- Layout Analysis
- 表格理解
- Document VLM
课程:
📄 Stage 4:Qwen3.5-VL 后训练(Post-Training)¶
学习 Qwen3.5-VL 多模态模型的后训练(Post-Training)技术,掌握实验室当前统一采用的训练框架、微调方法及实验管理工具。
主要内容:
- MS-SWIFT 训练框架
- Qwen3.5 Best Practice
- LoRA / QLoRA 微调
- SFT(Supervised Fine-Tuning)
- GRPO(Group Relative Policy Optimization)
- Weights & Biases(实验管理)
- Evaluation(模型评测)
课程:
🔬 Stage 5:科研项目实践¶
通过完整项目训练科研能力。
First Experiment¶
第一个完整科研项目实验流程:
包括:
- 数据准备
- 模型部署
- 实验设计
- Benchmark评测
🧪 Experiment 01¶
完整实验案例指导:
❓ FAQ¶
学习过程中常见问题:
➡️ FAQ
📅 推荐学习计划¶
| 周次 | 内容 |
|---|---|
| Week 1 | GitHub + Python环境 |
| Week 2 | Hugging Face + Transformers |
| Week 3 | Foundation Models |
| Week 4 | Document AI |
| Week 5 | Post Training |
| Week 6+ | 第一个科研实验 |
🎓 学习原则¶
本学习中心坚持:
Official First¶
优先学习官方文档。
Practice First¶
所有知识必须通过代码验证。
Research Oriented¶
最终目标:
从学习者成长为人工智能科研人员。
🚀 下一步¶
完成 Learning 模块后,建议进入:
阅读经典论文和技术报告
↓
AI模型实验自学教程
↓
开展实验研究工作
Last Updated: 2026-07-12