📊 Dataset Resources¶
推荐学习和实验使用以下公开数据集:
| Dataset | Task | Description | Official Link |
|---|---|---|---|
| OmniDocBench | Document Parsing | 文档解析、OCR、表格、公式、阅读顺序综合评测 | https://github.com/opendatalab/OmniDocBench |
| DocLayNet | Layout Analysis | 文档布局分析与页面元素检测 | https://github.com/DS4SD/DocLayNet |
| DocVQA | Document Question Answering | 文档视觉问答(Document VQA) | https://www.docvqa.org/ |
| PubTabNet | Table Recognition | 表格结构识别与HTML生成 | https://github.com/ibm-aur-nlp/PubTabNet |
| OCRBench | OCR Evaluation | 多模态模型 OCR 能力评测 | https://github.com/Yuliang-Liu/MultimodalOCR |
🚀 Recommended Usage¶
建议学习顺序:
| Stage | Dataset | Purpose |
|---|---|---|
| 1 | OCRBench | 了解多模态模型 OCR 能力 |
| 2 | DocLayNet | 学习文档布局分析 |
| 3 | OmniDocBench | 开展 Document AI Benchmark |
| 4 | DocVQA | 探索文档理解与推理 |
🔗 More Dataset Resources¶
| Platform | Description | Link |
|---|---|---|
| Hugging Face Datasets | 开源数据集平台 | https://huggingface.co/datasets |
| Papers With Code Datasets | 数据集与 Benchmark 导航 | https://paperswithcode.com/datasets |
| Kaggle Datasets | 在线数据集资源 | https://www.kaggle.com/datasets |