项目 01:文档理解与评测¶
使用
Qwen/Qwen3.5-0.8B· 对应 Week 4–7 · 项目最小路线 12–18 小时 · 产出可复现项目与小规模评测报告
这是学习中心第一个端到端项目。你的目标不只是运行一次模型,而是留下可复现、可比较、可解释的完整证据。
名称与范围
本项目使用官方模型 ID Qwen/Qwen3.5-0.8B。它是统一视觉—语言模型;“Qwen3.5-VL-0.8B”只是早期教学名称,不应出现在下载命令或实验记录里。本项目完成小规模课程评测,不等同于复现官方完整 Benchmark。
项目控制卡¶
| 项目字段 | 本项目约定 |
|---|---|
| 进入条件 | 有 3–5 个公开/授权文档样例;可运行 Python/Transformers;愿意按七关保存证据 |
| 唯一入口 | 从 Part 01 开始;每关结束后更新项目 README、实验日志并提交 Git |
| 版本 | 锁定 Qwen/Qwen3.5-0.8B revision、依赖、样例来源、Prompt、generation config 和代码 commit |
| 预计耗时 | 最小路线 12–18 小时;每关时间以控制台标注为准 |
| 算力与成本 | 小模型/小样例优先;可使用 CPU、免费 Kaggle 或已有环境;训练和付费资源不属于本项目最低要求 |
| 预期文件 | docs/project_plan.md、README、数据卡、run metadata、原始输出、run 表、指标表、错误案例和 project_summary.md |
| 完成判定 | 能重跑一组结果,关键结论可回到 Evidence Manifest,失败与限制被如实保留 |
| 路径 | 完成范围 |
|---|---|
| 最小 | 完成七关的最小动作:3–5 个样例、一个模型、baseline、一次受控对照、一个指标和失败案例 |
| 标准 | 完成全部七关证据、至少两组可比较实验、项目报告和最终自查 |
| 进阶 | 增加第二个模型/工具 baseline、切片评测或稳健性对照;先写资源上限 |
常见阻塞与恢复
- 没有固定研究问题:停在 Part 01,缩小为“一个变量—一个指标—一个失败案例”。
- 推理不可复现:回到模型 revision、依赖、Prompt、generation config 和输入样例。
- 无法公平比较:恢复固定样例与唯一变量;不要同时更换模型、Prompt 和数据。
- 指标与样例结论矛盾:保留两者,检查切片与错误分类,不挑选最好结果。
先写项目问题¶
开始操作前,把下面这句话补完整并写入 docs/project_plan.md:
在固定模型与样例的前提下,改变 _,会怎样影响 _?我将用 ____ 和失败案例来判断。
第一次完成项目时,可以这样填写:
在固定
Qwen/Qwen3.5-0.8B、3–5 个公开文档样例和 generation config 的前提下,改变 Prompt 约束,会怎样影响 文字完整度、结构保持和无依据回答?我将用 一个适合任务的指标和失败案例来判断。
七关控制台¶
1. 确定目标 · 45 分钟¶
写清研究问题、范围与成功标准。通过证据:docs/project_plan.md 和自检清单。
2. 创建仓库 · 45 分钟¶
建立研究仓库并完成首次提交。通过证据:可访问的 repository 与 commit 记录。
3. 组织目录 · 60 分钟¶
分开代码、配置、数据、输出与文档。通过证据:项目 README、标准目录和实验日志。
4. 准备数据 · 90 分钟¶
选择 3–5 个有差异的公开样例。通过证据:数据卡、样例清单、来源与 license 说明。
5. 完成推理 · 2–3 小时¶
使用官方模型 ID 跑通一次推理。通过证据:代码、metadata、运行命令与原始输出。
6. 受控对比 · 2–3 小时¶
固定模型和样例,只改变 Prompt 约束。通过证据:run 表、三组输出和差异分析。
7. 评测总结 · 2–3 小时¶
计算一个有效指标并解释失败。通过证据:指标表、错误案例与 project_summary.md。
每完成一关,在自己的 README 更新当前进度、最新运行命令、已知问题和下一步,并提交一次 Git。不要等到最后补实验记录。
每关产生的文件、版本、原始输出、失败案例和结论都应能映射到课程的Evidence Manifest。
官方材料只用四个入口¶
- Qwen/Qwen3.5-0.8B Model Card:模型 ID、当前用法、license 与能力边界;
- Transformers 多模态消息格式:图像与文本输入格式;
- OmniDocBench 官方数据集:数据卡、文件与使用限制;
- OmniDocBench 官方评测仓库:数据格式、配置和正式指标实现。
先完成最小路线
第一次只选 3–5 个样例、一个模型和一个研究变量。跑通并解释小实验后,再扩展完整数据集、更多模型或正式 OmniDocBench evaluation suite。
独立完成的三条规则¶
- 没有证据,不进入下一关:每关至少留下一个文件、一次原始输出或一个 commit。
- 一次只改一个变量:模型、样例、Prompt 和 generation config 不要同时改变。
- 失败也是结果:保留错误输出和未解决问题;不要把人工修订内容当作模型原始输出。
最终作品¶
Experiment_Result/
├── README.md
├── requirements.in
├── requirements-lock.txt
├── data/
├── scripts/
├── outputs/
│ ├── raw/
│ ├── metadata/
│ ├── figures/
│ └── logs/
├── experiments/
└── docs/
└── project_summary.md
作品必须包含:可复现入口、数据与模型来源、至少两组受控实验、原始结果、合适指标、失败案例以及有边界的结论。
完成标准¶
- 陌生同学能按 README 复现至少一组结果。
- 每项关键结论都能定位到输入、配置和原始输出。
- 报告能解释指标为何适合当前问题,并分析至少一个失败案例。
- 仓库不包含密钥、私人文档、未授权数据或被手工美化的模型结果。
完成后,可以继续探索 VLM 微调、完整 Document AI Benchmark、多模态 Agent 或视频理解项目。