跳转至

📊 Dataset Resources

推荐学习和实验使用以下公开数据集:

Dataset Task Description Official Link
OmniDocBench Document Parsing 文档解析、OCR、表格、公式、阅读顺序综合评测 https://github.com/opendatalab/OmniDocBench
DocLayNet Layout Analysis 文档布局分析与页面元素检测 https://github.com/DS4SD/DocLayNet
DocVQA Document Question Answering 文档视觉问答(Document VQA) https://www.docvqa.org/
PubTabNet Table Recognition 表格结构识别与HTML生成 https://github.com/ibm-aur-nlp/PubTabNet
OCRBench OCR Evaluation 多模态模型 OCR 能力评测 https://github.com/Yuliang-Liu/MultimodalOCR

🚀 Recommended Usage

建议学习顺序:

Stage Dataset Purpose
1 OCRBench 了解多模态模型 OCR 能力
2 DocLayNet 学习文档布局分析
3 OmniDocBench 开展 Document AI Benchmark
4 DocVQA 探索文档理解与推理

🔗 More Dataset Resources

Platform Description Link
Hugging Face Datasets 开源数据集平台 https://huggingface.co/datasets
Papers With Code Datasets 数据集与 Benchmark 导航 https://paperswithcode.com/datasets
Kaggle Datasets 在线数据集资源 https://www.kaggle.com/datasets