跳转至

💻 Tutorials

Multimodal Vision AI Tutorial Center

Kaggle Notebook Based Learning Platform


Overview

Tutorials 是 Multimodal Vision AI Learning Center 的实践入口。

本模块主要提供基于 Kaggle Notebook 的可运行实验案例。

学生无需复杂环境配置,可以直接在线运行 Notebook,快速体验:

  • 多模态大模型推理;
  • Vision Language Model 应用;
  • Document AI 实验;
  • OCR 与文档理解;
  • Benchmark 评测流程。

通过:

Open Notebook

      ↓

Run Code

      ↓

Observe Results

      ↓

Modify Experiment

      ↓

Explore Research

快速进入人工智能实践。


🎯 Tutorial Goals

通过 Tutorials 学习,你将能够:

  • 熟悉 Kaggle GPU 实验环境;
  • 运行主流开源 AI 模型;
  • 理解模型基本使用流程;
  • 完成简单实验修改;
  • 为后续科研实验打基础。

📚 Available Tutorials

Tutorial Topic Platform
OmniDocBench Kaggle Tutorial OmniDocBench Qwen2.5 Kaggle教程 Kaggle Notebook
Qwen3.5 SFT/GRPO Tutorial Qwen3.5(SFT / GRPO)微调教程 官方教程
------------------------------------------------------------------------

📌 Learning Principles

本模块坚持:

  • Run First ------ 先运行,再理解;
  • Code First ------ 通过代码学习;
  • Open Source First ------ 使用开源模型;
  • Research Oriented ------ 面向科研实践。

🔭 Future Tutorials

未来将持续增加:

  • Qwen-VL Series
  • InternVL
  • Florence
  • SmolDocling
  • PaddleOCR-VL
  • Multimodal Agents
  • Medical Vision AI

Learn · Practice · Explore

Multimodal Vision AI Learning Center