综述地图:先看清领域全景¶
本页整理多模态文档智能方向的代表性综述。它的用途不是增加阅读数量,而是帮助你确定任务边界、关键词和一个值得继续追问的问题。
本页最小任务
只选一篇与当前问题最接近的综述,画出 3 个研究方向、记录 5 个检索词,并写下 1 个可以被实验验证的问题。
阅读分层与模块学习卡¶
| 标签 | 预计时长 | 阅读范围 | 最小完成动作 |
|---|---|---|---|
| 必读 | 20–30 分钟 | 本页快速定位,再从 VLM、Document AI 或 Benchmark 中只选一篇综述的 Why Read | 写出 3 个方向、5 个检索词和 1 个问题 |
| 选读 | 1–2 小时 | 阅读所选综述的摘要、任务分类、方法图和限制 | 完成一页“领域地图”,标出当前项目的位置 |
| 深挖 | 半天至 1 周 | 回到综述原文及其引用的 2–3 篇代表论文 | 形成带原始来源的检索清单和最小研究假设 |
本页学习卡
学什么:领域边界、代表方法、常用检索词与开放问题。
官方来源:综述原文、作者主页及论文引用的原始工作。
做什么:只选择一条与当前问题最接近的综述路线。
提交什么:领域地图、检索词和一个可验证问题。
如何自查:能说明当前项目属于哪个任务、使用什么证据、仍缺什么验证。
本页快速定位¶
| 想了解的主题 | 直接进入 | 建议停在这里 |
|---|---|---|
| VLM 的模型、训练与评测全景 | Vision-Language Models | 能列出模型的 3 个核心组件 |
| 文档智能的任务边界 | Document AI | 能区分 OCR、版面与文档理解 |
| 文档解析与结构化输出 | Docling & Structured Documents | 能说明结构化输出比纯文本多保留什么 |
| 评测方法与挑战 | Benchmark Surveys | 能指出一个指标可能遗漏的能力 |
| 继续检索论文 | Recommended Resource Collections | 记录 5 个可复用检索词 |
| 安排阅读顺序 | Recommended Reading Plan | 选定下一篇精读论文 |
建议路线¶
Foundation Models
│
▼
Vision-Language Models
│
▼
Document AI
│
▼
Document Parsing
│
▼
DocTags / Docling
│
▼
Benchmarks
│
▼
AI Agent
阅读策略¶
| Priority | Description |
|---|---|
| ⭐⭐⭐⭐⭐ | 必读(建议精读) |
| ⭐⭐⭐⭐ | 建议阅读 |
| ⭐⭐⭐ | 作为扩展阅读 |
Part 1. Vision-Language Models¶
1. A Comprehensive Survey of Vision-Language Models¶
Priority
⭐⭐⭐⭐⭐
Year
2026
Journal
Information Fusion
Author Manuscript¶
https://minhdl93.github.io/public/papers/if_25.pdf
Why Read¶
目前最系统的 VLM 综述之一,覆盖:
- Vision Encoder
- LLM Backbone
- Instruction Tuning
- Prompt Engineering
- Adapter / LoRA
- Benchmark
- Efficient VLM
非常适合作为实验室学习 VLM 的第一篇综述。
2. Benchmark Evaluations, Applications, and Challenges of Large Vision Language Models¶
Priority
⭐⭐⭐⭐⭐
Year
2025
Paper¶
https://arxiv.org/abs/2501.02189
GitHub¶
https://github.com/zli12321/Vision-Language-Models-Overview
Why Read¶
重点介绍:
- 主流 VLM
- Benchmark
- Evaluation
- Applications
- Challenges
推荐作为 VLM Benchmark 的参考文献。
3. A Survey on Efficient Vision-Language Models¶
Priority
⭐⭐⭐⭐
Year
2025
Paper¶
https://arxiv.org/abs/2504.09724
GitHub¶
https://github.com/MPSC-UMBC/Efficient-Vision-Language-Models-A-Survey
Why Read¶
重点关注:
- Mobile VLM
- Edge AI
- Efficient Inference
- Parameter-efficient Fine-tuning
适合关注轻量化 VLM 的学生。
Part 2. Document AI¶
4. Document Intelligence in the Era of Large Language Models¶
Priority
⭐⭐⭐⭐⭐
Year
2025
Paper¶
https://arxiv.org/abs/2510.13366
Why Read¶
近年来 Document AI 最值得阅读的综述之一。
重点讨论:
- LLM for Document AI
- Multimodal Document Understanding
- Document Parsing
- Retrieval-Augmented Document AI
- Agent-based Document Intelligence
非常契合未来实验室研究方向。
5. Deep Learning based Visually Rich Document Content Understanding¶
Priority
⭐⭐⭐⭐⭐
Year
2026
Journal
Artificial Intelligence Review
Paper¶
https://link.springer.com/article/10.1007/s10462-025-11477-3
Why Read¶
系统总结:
- Layout Analysis
- OCR
- KIE
- Table Recognition
- Document Parsing
- Vision-Language Methods
是目前最新的 VRD(Visually Rich Documents)综述之一。
Part 3. Docling & Structured Documents¶
6. Docling: An Efficient Open-Source Toolkit for AI-driven Document Conversion¶
Priority
⭐⭐⭐⭐⭐
Year
2025
Paper¶
https://arxiv.org/abs/2501.17887
IBM Research¶
Official Documentation¶
https://docling-project.github.io/docling/
GitHub¶
https://github.com/docling-project/docling
Why Read¶
Docling 是当前最重要的开源文档转换框架。
建议重点理解:
- Unified Document Representation
- DoclingDocument
- DocTags
- Modular Pipeline
- RAG Integration
7. SmolDocling¶
Priority
⭐⭐⭐⭐⭐
Year
2025
Paper¶
https://arxiv.org/abs/2503.11576
Official Papers¶
Why Read¶
SmolDocling 首次提出:
- End-to-End Document Conversion
- DocTags Generation
- Ultra-compact Document VLM
代表新一代 Document Foundation Model。
Part 4. Benchmark Surveys¶
8. OCRBench v2¶
Priority
⭐⭐⭐⭐⭐
Paper¶
https://arxiv.org/abs/2501.00321
GitHub¶
https://github.com/Yuliang-Liu/MultimodalOCR
Why Read¶
了解:
- OCR Evaluation
- Visual Grounding
- OCR Reasoning
- LMM Evaluation
是当前 OCR Benchmark 的代表工作。
9. MMDocBench¶
Priority
⭐⭐⭐⭐⭐
Paper¶
https://arxiv.org/abs/2410.21311
Project¶
Why Read¶
重点理解:
- OCR-free Evaluation
- Fine-grained Grounding
- Multi-task Evaluation
- Vision-Language Benchmark
适合研究 Qwen3-VL、InternVL 等模型。
Part 5. Recommended Resource Collections¶
Awesome Lists¶
| Resource | URL |
|---|---|
| Awesome Vision-Language Models | https://github.com/zli12321/Vision-Language-Models-Overview |
| Docling Papers | https://docling.ai/papers/ |
| AMiner / 智谱 AI | https://www.aminer.cn/ |
| Hugging Face Papers | https://huggingface.co/papers |
Conference Proceedings¶
| Conference | URL |
|---|---|
| AMiner / 智谱 AI | https://www.aminer.cn/ |
| ECCV Proceedings | https://eccv.ecva.net |
| ACL Anthology | https://aclanthology.org |
| NeurIPS Proceedings | https://papers.nips.cc |
| ICML Proceedings | https://proceedings.mlr.press |
Recommended Reading Plan¶
| Week | Reading |
|---|---|
| Week 1 | VLM Survey(Paper 1) |
| Week 2 | Efficient VLM Survey(Paper 3) |
| Week 3 | Document AI Survey(Paper 4) |
| Week 4 | VRD Survey(Paper 5) |
| Week 5 | Docling(Paper 6) |
| Week 6 | SmolDocling(Paper 7) |
| Week 7 | OCRBench v2(Paper 8) |
| Week 8 | MMDocBench(Paper 9) |
Laboratory Recommended Reading Order¶
建议实验室统一采用如下阅读路线:
Survey Papers
│
▼
Foundation Models
│
▼
Vision-Language Models
│
▼
Document AI
│
▼
Docling
│
▼
DocTags
│
▼
Benchmarks
│
▼
Research Projects
Learning Objectives¶
完成本章节后,应能够:
- 系统理解 Vision-Language Model 的发展脉络;
- 掌握 Document AI 的主要研究方向与关键挑战;
- 理解 Docling、DocTags 等新一代结构化文档技术;
- 熟悉主流 Benchmark 与评价体系;
- 能够快速定位高质量论文,并独立阅读 CVPR、ICCV、ECCV、ACL、EMNLP、ICML、NeurIPS 等顶级会议的最新研究成果。