跳转至

项目 01:文档理解与评测

使用 Qwen/Qwen3.5-0.8B · 对应 Week 4–7 · 项目最小路线 12–18 小时 · 产出可复现项目与小规模评测报告

从 Part 01 开始 返回项目列表

这是学习中心第一个端到端项目。你的目标不只是运行一次模型,而是留下可复现、可比较、可解释的完整证据。

名称与范围

本项目使用官方模型 ID Qwen/Qwen3.5-0.8B。它是统一视觉—语言模型;“Qwen3.5-VL-0.8B”只是早期教学名称,不应出现在下载命令或实验记录里。本项目完成小规模课程评测,不等同于复现官方完整 Benchmark。

项目控制卡

项目字段 本项目约定
进入条件 有 3–5 个公开/授权文档样例;可运行 Python/Transformers;愿意按七关保存证据
唯一入口 从 Part 01 开始;每关结束后更新项目 README、实验日志并提交 Git
版本 锁定 Qwen/Qwen3.5-0.8B revision、依赖、样例来源、Prompt、generation config 和代码 commit
预计耗时 最小路线 12–18 小时;每关时间以控制台标注为准
算力与成本 小模型/小样例优先;可使用 CPU、免费 Kaggle 或已有环境;训练和付费资源不属于本项目最低要求
预期文件 docs/project_plan.md、README、数据卡、run metadata、原始输出、run 表、指标表、错误案例和 project_summary.md
完成判定 能重跑一组结果,关键结论可回到 Evidence Manifest,失败与限制被如实保留
路径 完成范围
最小 完成七关的最小动作:3–5 个样例、一个模型、baseline、一次受控对照、一个指标和失败案例
标准 完成全部七关证据、至少两组可比较实验、项目报告和最终自查
进阶 增加第二个模型/工具 baseline、切片评测或稳健性对照;先写资源上限

常见阻塞与恢复

  • 没有固定研究问题:停在 Part 01,缩小为“一个变量—一个指标—一个失败案例”。
  • 推理不可复现:回到模型 revision、依赖、Prompt、generation config 和输入样例。
  • 无法公平比较:恢复固定样例与唯一变量;不要同时更换模型、Prompt 和数据。
  • 指标与样例结论矛盾:保留两者,检查切片与错误分类,不挑选最好结果。

先写项目问题

开始操作前,把下面这句话补完整并写入 docs/project_plan.md:

在固定模型与样例的前提下,改变 _,会怎样影响 _?我将用 ____ 和失败案例来判断。

第一次完成项目时,可以这样填写:

在固定 Qwen/Qwen3.5-0.8B、3–5 个公开文档样例和 generation config 的前提下,改变 Prompt 约束,会怎样影响 文字完整度、结构保持和无依据回答?我将用 一个适合任务的指标和失败案例来判断。

七关控制台

1. 确定目标 · 45 分钟

写清研究问题、范围与成功标准。通过证据:docs/project_plan.md 和自检清单。

2. 创建仓库 · 45 分钟

建立研究仓库并完成首次提交。通过证据:可访问的 repository 与 commit 记录。

3. 组织目录 · 60 分钟

分开代码、配置、数据、输出与文档。通过证据:项目 README、标准目录和实验日志。

4. 准备数据 · 90 分钟

选择 3–5 个有差异的公开样例。通过证据:数据卡、样例清单、来源与 license 说明。

5. 完成推理 · 2–3 小时

使用官方模型 ID 跑通一次推理。通过证据:代码、metadata、运行命令与原始输出。

6. 受控对比 · 2–3 小时

固定模型和样例,只改变 Prompt 约束。通过证据:run 表、三组输出和差异分析。

7. 评测总结 · 2–3 小时

计算一个有效指标并解释失败。通过证据:指标表、错误案例与 project_summary.md。

每完成一关,在自己的 README 更新当前进度、最新运行命令、已知问题和下一步,并提交一次 Git。不要等到最后补实验记录。

每关产生的文件、版本、原始输出、失败案例和结论都应能映射到课程的Evidence Manifest。

官方材料只用四个入口

  1. Qwen/Qwen3.5-0.8B Model Card:模型 ID、当前用法、license 与能力边界;
  2. Transformers 多模态消息格式:图像与文本输入格式;
  3. OmniDocBench 官方数据集:数据卡、文件与使用限制;
  4. OmniDocBench 官方评测仓库:数据格式、配置和正式指标实现。

先完成最小路线

第一次只选 3–5 个样例、一个模型和一个研究变量。跑通并解释小实验后,再扩展完整数据集、更多模型或正式 OmniDocBench evaluation suite。

独立完成的三条规则

  1. 没有证据,不进入下一关:每关至少留下一个文件、一次原始输出或一个 commit。
  2. 一次只改一个变量:模型、样例、Prompt 和 generation config 不要同时改变。
  3. 失败也是结果:保留错误输出和未解决问题;不要把人工修订内容当作模型原始输出。

最终作品

Experiment_Result/
├── README.md
├── requirements.in
├── requirements-lock.txt
├── data/
├── scripts/
├── outputs/
│   ├── raw/
│   ├── metadata/
│   ├── figures/
│   └── logs/
├── experiments/
└── docs/
    └── project_summary.md

作品必须包含:可复现入口、数据与模型来源、至少两组受控实验、原始结果、合适指标、失败案例以及有边界的结论。

完成标准

  • 陌生同学能按 README 复现至少一组结果。
  • 每项关键结论都能定位到输入、配置和原始输出。
  • 报告能解释指标为何适合当前问题,并分析至少一个失败案例。
  • 仓库不包含密钥、私人文档、未授权数据或被手工美化的模型结果。

完成后,可以继续探索 VLM 微调、完整 Document AI Benchmark、多模态 Agent 或视频理解项目。