跳转至

论文导读:先找到问题,再选择论文

这里不是需要从头读到尾的论文清单。先明确自己要解决的问题,再直接进入相关章节;每次阅读只需形成一条 主张—证据—限制—下一步 的证据链。

按问题快速定位 选择评测基准

完成本模块后

你能够用一页笔记说清楚论文研究了什么、证据是否充分、哪里仍不确定,以及下一步最值得验证什么。

论文导读模块学习卡

学什么:识别研究问题、核心主张、关键证据、限制与下一步。
官方来源:正式论文或 arXiv、作者项目、官方代码和数据集主页。
做什么:先按问题选择一个入口,只读到足以完成本次输出。
提交什么:一页 Paper Card;深挖时再提交最小复现实验。
如何自查:能区分论文事实、作者解释和自己的推测,并把结论指向具体证据。

阅读深度标签

标签 预计时长 你需要完成什么
必读 20–30 分钟 阅读页面指定核心节点,写下“问题—主张—一个疑问”
选读 1–2 小时 按当前任务选择方法、数据或评测章节,完成一页 Paper Card
深挖 半天至 1 周 回到论文、代码与数据,复现一个最小主张并保存证据

“必读”不是要求读完整篇页面;达到最小完成动作即可停止。只有当前项目确实需要时,再进入选读或深挖。

1 分钟使用方法

  1. 在下表选择最接近当前任务的问题。
  2. 点击具体模型、方法或评测入口,不必先浏览整篇长文档。
  3. 阅读到能够完成“本次输出”时停止,再决定是否继续精读。

按问题快速定位

你现在想解决什么 直接阅读 本次输出
快速了解领域版图 VLM 综述 · Document AI 综述 3 个方向、5 个检索词、1 个问题
补齐 VLM 架构基础 Transformer · ViT · CLIP 一张“图像 token 如何进入语言模型”的结构图
选择视觉语言模型 VLM 基本结构 · Qwen3-VL · Qwen3.5 官方模型 模型选择理由及一个能力边界
开展文档解析实验 Docling · MinerU · OmniDocBench 输入、输出、指标和一个失败样例
理解结构化文档 DocTags 核心结构 · Reading Order · Provenance 一页文档的信息损失对照表
为项目选择评测 按任务选择 · 选择策略 · 评测流程 研究问题、数据集、指标、失败案例

三条推荐路线

综述地图 → 基础模型 → 视觉语言模型

目标:知道领域在研究什么,并能画出一个 VLM 的基本结构。

文档智能 → 评测基准 → 动手教程

目标:选定模型、数据、指标和失败案例,不再只看主观输出。

综述地图 → DocTags → 现代 VLM 趋势

目标:找到现有方法仍未解决的问题,并设计一个最小验证实验。

重点只学三件事

  1. 找出核心主张:作者解决了什么问题,相比已有方法只改变了什么。
  2. 检查关键证据:数据、指标、对照实验和失败案例能否支持这个主张。
  3. 提出下一步验证:选择一个在现有时间和算力下可以复现或反驳的最小问题。

如果一次阅读没有留下“主张—证据—限制—下一步”,它暂时还只是浏览。

完整学习路线

  1. 建立地图:阅读综述地图,写下 3 个关键词和 1 个真正想知道的问题。
  2. 理解方法:根据问题进入文档智能或视觉语言模型,找出方法相对 baseline 的关键变化。
  3. 核对证据:进入评测基准,判断论文选择的数据与指标是否真的回答了研究问题。
  4. 形成行动:到 Week 11 选择一篇有官方论文、公开代码和可用数据的工作,只复现其中一个最小主张。

基础概念不清楚时,再回到基础模型补齐 Transformer、ViT 与 CLIP;需要研究结构化文档表示时,进入DocTags。

带着问题选入口

当前主线与未来扩展

目前以文档理解和视觉语言模型为主。未来扩展到视频理解时,仍会沿用视觉—语言对齐、证据定位、时序理解和可靠评测这条能力主线。

必做任务:完成一页论文卡

选择一篇与当前课程任务直接相关的论文,用自己的话回答五个问题:

  1. 问题:论文要解决什么,明确不解决什么?
  2. 主张:相对 baseline,作者认为哪一项改变有效?
  3. 证据:哪组数据、指标或消融最能支持这个主张?
  4. 限制:哪个失败案例、数据偏差或实验缺口会削弱主张?
  5. 行动:你能用什么最小实验继续验证?成功标准是什么?
# Paper Card
- Paper / version / official URL:
- 研究问题与非目标:
- 核心主张:
- 最关键的证据:
- 一个限制或失败案例:
- 我能验证的最小问题:
- 所需数据、算力与成功标准:

如何判断已经学会

  • 不看摘要,也能用两句话说明研究问题和核心主张。
  • 能指出一项真正支持主张的实验,而不是只复述最高分。
  • 能区分论文事实、作者解释和自己的推测。
  • 能提出一个变量明确、结果可检查的后续实验。

按时间选择深度

  • 30 分钟:读摘要、方法图和限制,完成“问题—主张—疑问”。
  • 2 小时:核对数据、指标、baseline 与一项消融,形成完整证据链。
  • 1 周:先写成功标准,再复现一个最小主张,并保留代码、配置和原始结果。

只把原始来源当作事实依据

论文事实以正式论文或 arXiv 原文、作者官方项目和数据集主页为准。博客与视频可以帮助理解,但不能替代原始引用。

学完去哪里

需要跑通代码,进入动手教程;准备把问题做成完整作品,进入项目实战;Week 11 的学习任务见12 周课程路线。