数据集索引:先按任务选择¶
数据集不是越大越好。先确定要验证的能力,再检查样例、标注、划分、指标和 license 是否支持这个问题。
文档解析¶
OmniDocBench¶
覆盖文字、公式、表格、阅读顺序等文档解析能力,是项目 01 的主要评测参考。
先学什么:数据格式、页面类别、官方指标分别评价什么,以及完整评测与课程小样例评测的区别。
版面分析¶
DocLayNet¶
用于文档布局分析和页面元素检测。
先学什么:类别定义、标注格式、训练/验证/测试划分,以及版面检测结果如何影响后续阅读顺序和结构恢复。
文档问答¶
DocVQA¶
用于研究模型能否根据文档视觉内容回答问题。
先学什么:问题类型、答案形式、ANLS 等指标,以及模型回答正确但证据定位不可靠的情况。
表格结构¶
PubTabNet¶
用于表格识别与 HTML 结构生成。
先学什么:结构标注如何表示合并单元格,以及 TEDS 一类结构指标与人工可读性的差异。
视觉文字能力¶
OCRBench / OCRBench v2¶
用于评测多模态模型的文字识别、定位与推理能力。
先学什么:任务覆盖、公开与私有评测划分,以及总分是否掩盖不同场景的失败。
下载前必须回答¶
- 数据来自哪里,允许怎样使用和公开?
- 哪个 split 用于开发,哪个只能用于最终评测?
- 指标是否真的对应当前研究问题?
- 先用哪 3–5 个样例检查格式与流程?
- 是否记录数据版本、下载日期和必要校验信息?
课程中的使用顺序¶
- 先浏览 3–5 个样例,理解输入、标注与困难点。
- 跑通一条数据读取和模型推理链路。
- 只选一个与问题匹配的指标。
- 解释至少一个失败案例,再决定是否扩大数据规模。
不要直接提交数据
原始数据通常不应直接放入课程仓库。优先提交来源、下载说明、manifest、处理脚本和小型合规样例,并遵守各数据集的 license 与访问要求。
链接核对日期:2026-08-07