跳转至

综述地图:先看清领域全景

本页整理多模态文档智能方向的代表性综述。它的用途不是增加阅读数量,而是帮助你确定任务边界、关键词和一个值得继续追问的问题。

本页最小任务

只选一篇与当前问题最接近的综述,画出 3 个研究方向、记录 5 个检索词,并写下 1 个可以被实验验证的问题。

阅读分层与模块学习卡

标签 预计时长 阅读范围 最小完成动作
必读 20–30 分钟 本页快速定位,再从 VLM、Document AI 或 Benchmark 中只选一篇综述的 Why Read 写出 3 个方向、5 个检索词和 1 个问题
选读 1–2 小时 阅读所选综述的摘要、任务分类、方法图和限制 完成一页“领域地图”,标出当前项目的位置
深挖 半天至 1 周 回到综述原文及其引用的 2–3 篇代表论文 形成带原始来源的检索清单和最小研究假设

本页学习卡

学什么:领域边界、代表方法、常用检索词与开放问题。
官方来源:综述原文、作者主页及论文引用的原始工作。
做什么:只选择一条与当前问题最接近的综述路线。
提交什么:领域地图、检索词和一个可验证问题。
如何自查:能说明当前项目属于哪个任务、使用什么证据、仍缺什么验证。

本页快速定位

想了解的主题 直接进入 建议停在这里
VLM 的模型、训练与评测全景 Vision-Language Models 能列出模型的 3 个核心组件
文档智能的任务边界 Document AI 能区分 OCR、版面与文档理解
文档解析与结构化输出 Docling & Structured Documents 能说明结构化输出比纯文本多保留什么
评测方法与挑战 Benchmark Surveys 能指出一个指标可能遗漏的能力
继续检索论文 Recommended Resource Collections 记录 5 个可复用检索词
安排阅读顺序 Recommended Reading Plan 选定下一篇精读论文

建议路线

Foundation Models
        │
        ▼
Vision-Language Models
        │
        ▼
Document AI
        │
        ▼
Document Parsing
        │
        ▼
DocTags / Docling
        │
        ▼
Benchmarks
        │
        ▼
AI Agent

阅读策略

Priority Description
⭐⭐⭐⭐⭐ 必读(建议精读)
⭐⭐⭐⭐ 建议阅读
⭐⭐⭐ 作为扩展阅读

Part 1. Vision-Language Models

1. A Comprehensive Survey of Vision-Language Models

Priority

⭐⭐⭐⭐⭐

Year

2026

Journal

Information Fusion

Author Manuscript

https://minhdl93.github.io/public/papers/if_25.pdf

Why Read

目前最系统的 VLM 综述之一,覆盖:

  • Vision Encoder
  • LLM Backbone
  • Instruction Tuning
  • Prompt Engineering
  • Adapter / LoRA
  • Benchmark
  • Efficient VLM

非常适合作为实验室学习 VLM 的第一篇综述。


2. Benchmark Evaluations, Applications, and Challenges of Large Vision Language Models

Priority

⭐⭐⭐⭐⭐

Year

2025

Paper

https://arxiv.org/abs/2501.02189

GitHub

https://github.com/zli12321/Vision-Language-Models-Overview

Why Read

重点介绍:

  • 主流 VLM
  • Benchmark
  • Evaluation
  • Applications
  • Challenges

推荐作为 VLM Benchmark 的参考文献。


3. A Survey on Efficient Vision-Language Models

Priority

⭐⭐⭐⭐

Year

2025

Paper

https://arxiv.org/abs/2504.09724

GitHub

https://github.com/MPSC-UMBC/Efficient-Vision-Language-Models-A-Survey

Why Read

重点关注:

  • Mobile VLM
  • Edge AI
  • Efficient Inference
  • Parameter-efficient Fine-tuning

适合关注轻量化 VLM 的学生。


Part 2. Document AI

4. Document Intelligence in the Era of Large Language Models

Priority

⭐⭐⭐⭐⭐

Year

2025

Paper

https://arxiv.org/abs/2510.13366

Why Read

近年来 Document AI 最值得阅读的综述之一。

重点讨论:

  • LLM for Document AI
  • Multimodal Document Understanding
  • Document Parsing
  • Retrieval-Augmented Document AI
  • Agent-based Document Intelligence

非常契合未来实验室研究方向。


5. Deep Learning based Visually Rich Document Content Understanding

Priority

⭐⭐⭐⭐⭐

Year

2026

Journal

Artificial Intelligence Review

Paper

https://link.springer.com/article/10.1007/s10462-025-11477-3

Why Read

系统总结:

  • Layout Analysis
  • OCR
  • KIE
  • Table Recognition
  • Document Parsing
  • Vision-Language Methods

是目前最新的 VRD(Visually Rich Documents)综述之一。


Part 3. Docling & Structured Documents

6. Docling: An Efficient Open-Source Toolkit for AI-driven Document Conversion

Priority

⭐⭐⭐⭐⭐

Year

2025

Paper

https://arxiv.org/abs/2501.17887

IBM Research

https://research.ibm.com/publications/docling-an-efficient-open-source-toolkit-for-ai-driven-document-conversion

Official Documentation

https://docling-project.github.io/docling/

GitHub

https://github.com/docling-project/docling

Why Read

Docling 是当前最重要的开源文档转换框架。

建议重点理解:

  • Unified Document Representation
  • DoclingDocument
  • DocTags
  • Modular Pipeline
  • RAG Integration

7. SmolDocling

Priority

⭐⭐⭐⭐⭐

Year

2025

Paper

https://arxiv.org/abs/2503.11576

Official Papers

https://docling.ai/papers/

Why Read

SmolDocling 首次提出:

  • End-to-End Document Conversion
  • DocTags Generation
  • Ultra-compact Document VLM

代表新一代 Document Foundation Model。


Part 4. Benchmark Surveys

8. OCRBench v2

Priority

⭐⭐⭐⭐⭐

Paper

https://arxiv.org/abs/2501.00321

GitHub

https://github.com/Yuliang-Liu/MultimodalOCR

Why Read

了解:

  • OCR Evaluation
  • Visual Grounding
  • OCR Reasoning
  • LMM Evaluation

是当前 OCR Benchmark 的代表工作。


9. MMDocBench

Priority

⭐⭐⭐⭐⭐

Paper

https://arxiv.org/abs/2410.21311

Project

https://mmdocbench.github.io/

Why Read

重点理解:

  • OCR-free Evaluation
  • Fine-grained Grounding
  • Multi-task Evaluation
  • Vision-Language Benchmark

适合研究 Qwen3-VL、InternVL 等模型。


Part 5. Recommended Resource Collections

Awesome Lists

Resource URL
Awesome Vision-Language Models https://github.com/zli12321/Vision-Language-Models-Overview
Docling Papers https://docling.ai/papers/
AMiner / 智谱 AI https://www.aminer.cn/
Hugging Face Papers https://huggingface.co/papers

Conference Proceedings

Conference URL
AMiner / 智谱 AI https://www.aminer.cn/
ECCV Proceedings https://eccv.ecva.net
ACL Anthology https://aclanthology.org
NeurIPS Proceedings https://papers.nips.cc
ICML Proceedings https://proceedings.mlr.press

Recommended Reading Plan

Week Reading
Week 1 VLM Survey(Paper 1)
Week 2 Efficient VLM Survey(Paper 3)
Week 3 Document AI Survey(Paper 4)
Week 4 VRD Survey(Paper 5)
Week 5 Docling(Paper 6)
Week 6 SmolDocling(Paper 7)
Week 7 OCRBench v2(Paper 8)
Week 8 MMDocBench(Paper 9)

Laboratory Recommended Reading Order

建议实验室统一采用如下阅读路线:

Survey Papers
      │
      ▼
Foundation Models
      │
      ▼
Vision-Language Models
      │
      ▼
Document AI
      │
      ▼
Docling
      │
      ▼
DocTags
      │
      ▼
Benchmarks
      │
      ▼
Research Projects

Learning Objectives

完成本章节后,应能够:

  • 系统理解 Vision-Language Model 的发展脉络;
  • 掌握 Document AI 的主要研究方向与关键挑战;
  • 理解 Docling、DocTags 等新一代结构化文档技术;
  • 熟悉主流 Benchmark 与评价体系;
  • 能够快速定位高质量论文,并独立阅读 CVPR、ICCV、ECCV、ACL、EMNLP、ICML、NeurIPS 等顶级会议的最新研究成果。

返回上一级 下一章