自主评估与证据指南¶
本课程不设置导师评分、排名或通关审批。学生通过代码、配置、原始结果和研究记录判断当前成果处于哪个阶段,并据此决定补齐主线或进入探索任务。
个人仓库建议结构¶
student-bootcamp/
├── README.md
├── environment.yml # 或 requirements.txt / pyproject.toml
├── learning-log.md
├── week01/ ... week11/
└── final-project/
每周至少保留:
README.md:本周问题、运行命令、结果、限制和下一步;- 源代码或 Notebook:能够从头运行,不依赖隐藏状态;
- 配置与版本:模型、数据、依赖、seed 和唯一改动;
- 原始结果:能够支持结论,也保留失败输出;
- 自主记录:探索方向、AI 使用、当前困难和例会准备。
禁止提交 API key、私人文档、未授权数据和不必要的大模型权重。大文件使用远程 artifact 或 Hub,并在仓库记录版本、来源和必要校验信息。
唯一证据清单¶
每周专题、教程和项目都使用同一份 Evidence Manifest。不要求每项都做成独立文件,但 README、metadata、配置、日志或报告必须能清楚定位这些信息。
| 证据项 | 最低要求 |
|---|---|
| 任务与路径 | 当前问题,以及选择最小 / 标准 / 进阶路径的理由 |
| 运行入口 | 唯一开始命令、Notebook URL 或官方入口 |
| 版本 | Git commit、环境、模型/数据 revision 和关键依赖 |
| 输入与来源 | 数据/样例来源、license、split 与必要的隐私说明 |
| 配置与唯一变量 | seed、参数、Prompt、实验配置和本轮唯一改动 |
| 原始结果 | 未手工修改的 prediction、日志、metrics 或导出文件 |
| 指标与失败案例 | 主指标、切片结果及至少一个代表性失败案例 |
| 耗时与成本 | 预计/实际耗时、设备、GPU/云资源与费用上限或实际成本 |
| AI 使用披露 | AI 工具参与范围,以及人工核验方式 |
| 结论与下一步 | 当前结论、限制、仍未知问题和下一步最小验证 |
怎样使用
最小路径也必须记录运行入口、版本、原始结果和一个边界;标准路径以达到“可复现”或“可解释”为目标;进阶路径在相同证据基础上增加受控探索,而不是单纯增加模型规模。
五个自主阶段¶
| 阶段 | 怎样判断 | 下一步建议 |
|---|---|---|
| 未形成 | 只有阅读或尝试,没有稳定运行结果 | 缩小到一个样例和一条命令 |
| 已跑通 | 最小任务成功,但记录或测试不完整 | 补齐版本、配置、错误处理和原始输出 |
| 可复现 | 另一位同学能根据 README 重新运行 | 增加指标、失败案例和解释 |
| 可解释 | 能说明方法、证据、失败和限制 | 选择一个自主探索方向 |
| 可扩展 | 能提出并验证新的问题 | 整理公开作品或进入更深入研究 |
课程不要求所有学生每周都达到“可扩展”。主线达到“可复现”或“可解释”后即可继续;如果尚未达到,也不需要等待导师批准,而是在下一周优先补齐关键证据。
| 学习路径 | 建议达到的阶段 | 说明 |
|---|---|---|
| 最小 | 已跑通(证据可追溯) | 可缩小模型和数据,但不能省略入口、版本、原始结果和限制 |
| 标准 | 可复现或可解释 | 完成课程主线,并能让他人按 README 检查一组结果 |
| 进阶 | 可解释 → 可扩展 | 在标准证据基础上增加单变量探索、消融或稳健性验证 |
每周从五个方面自查¶
1. 本周成果¶
- 完成了本周最小可运行成果。
- 结果与本周核心问题直接相关。
- 没有用额外规模掩盖主线尚未跑通的问题。
2. 可复现性¶
- README 提供唯一、可复制的开始命令。
- 环境、模型、数据、配置和 seed 可追溯。
- Notebook 从头运行,不依赖隐藏状态。
3. 证据完整性¶
- 结论能回到输入、配置和原始输出。
- 包含测试、指标或预先定义的人工检查。
- 失败案例和负面结果没有被删除。
4. 理解与边界¶
- 能用自己的话解释方法和关键设置。
- 能区分事实、结果、解释和推测。
- 明确写出限制、不适用场景和仍未知的问题。
5. 负责任使用¶
- AI 参与范围和人工验证方式清楚。
- 模型、论文、数据和工具均能追溯到来源。
- 仓库没有密钥、隐私材料和不明授权数据。
自主选择下一步¶
- 主线未跑通:缩小模型、数据和任务,只保留一个样例、一次运行和一个判断。
- 已经跑通但不可复现:优先补 README、版本、配置、日志和原始结果。
- 已经可复现:增加一个有效指标或一个有代表性的失败案例。
- 已经可解释:从本周提供的方向中选择一个受控探索任务。
- 已经可扩展:形成论文问题、公开项目或未来四周计划。
每周例会¶
例会用于交流,不是评分或验收。每位学生准备五项内容:
- 本周真正完成了什么;
- 最有说服力的证据在哪里;
- 最大失败或意外是什么;
- 选择了哪个探索方向;
- 下周首先准备解决什么。
导师可以听取进展、提出澄清问题、提醒研究风险和推荐官方入口,但不修改学生的自主判断,也不决定学生能否进入下一周。
最终项目自查¶
- 陌生同学能从 README 复现至少一组结果。
- 数据来源、模型 revision、配置和运行命令完整。
- baseline、改进方法和统一评测可以公平比较。
- 图表和结论能够由原始结果重新生成。
- 失败、成本、限制和伦理风险被如实报告。
- AI 使用、人工验证和个人判断清楚。
- 后续探索问题具体、可执行、可检查。