跳转至

数据集索引:先按任务选择

数据集不是越大越好。先确定要验证的能力,再检查样例、标注、划分、指标和 license 是否支持这个问题。

文档解析

OmniDocBench

覆盖文字、公式、表格、阅读顺序等文档解析能力,是项目 01 的主要评测参考。

先学什么:数据格式、页面类别、官方指标分别评价什么,以及完整评测与课程小样例评测的区别。

版面分析

DocLayNet

用于文档布局分析和页面元素检测。

先学什么:类别定义、标注格式、训练/验证/测试划分,以及版面检测结果如何影响后续阅读顺序和结构恢复。

文档问答

DocVQA

用于研究模型能否根据文档视觉内容回答问题。

先学什么:问题类型、答案形式、ANLS 等指标,以及模型回答正确但证据定位不可靠的情况。

表格结构

PubTabNet

用于表格识别与 HTML 结构生成。

先学什么:结构标注如何表示合并单元格,以及 TEDS 一类结构指标与人工可读性的差异。

视觉文字能力

OCRBench / OCRBench v2

用于评测多模态模型的文字识别、定位与推理能力。

先学什么:任务覆盖、公开与私有评测划分,以及总分是否掩盖不同场景的失败。

下载前必须回答

  • 数据来自哪里,允许怎样使用和公开?
  • 哪个 split 用于开发,哪个只能用于最终评测?
  • 指标是否真的对应当前研究问题?
  • 先用哪 3–5 个样例检查格式与流程?
  • 是否记录数据版本、下载日期和必要校验信息?

课程中的使用顺序

  1. 先浏览 3–5 个样例,理解输入、标注与困难点。
  2. 跑通一条数据读取和模型推理链路。
  3. 只选一个与问题匹配的指标。
  4. 解释至少一个失败案例,再决定是否扩大数据规模。

不要直接提交数据

原始数据通常不应直接放入课程仓库。优先提交来源、下载说明、manifest、处理脚本和小型合规样例,并遵守各数据集的 license 与访问要求。

链接核对日期:2026-08-07