跳转至

自主评估与证据指南

本课程不设置导师评分、排名或通关审批。学生通过代码、配置、原始结果和研究记录判断当前成果处于哪个阶段,并据此决定补齐主线或进入探索任务。

复制学习记录模板 返回 12 周路线

个人仓库建议结构

student-bootcamp/
├── README.md
├── environment.yml          # 或 requirements.txt / pyproject.toml
├── learning-log.md
├── week01/ ... week11/
└── final-project/

每周至少保留:

  • README.md:本周问题、运行命令、结果、限制和下一步;
  • 源代码或 Notebook:能够从头运行,不依赖隐藏状态;
  • 配置与版本:模型、数据、依赖、seed 和唯一改动;
  • 原始结果:能够支持结论,也保留失败输出;
  • 自主记录:探索方向、AI 使用、当前困难和例会准备。

禁止提交 API key、私人文档、未授权数据和不必要的大模型权重。大文件使用远程 artifact 或 Hub,并在仓库记录版本、来源和必要校验信息。

唯一证据清单

每周专题、教程和项目都使用同一份 Evidence Manifest。不要求每项都做成独立文件,但 README、metadata、配置、日志或报告必须能清楚定位这些信息。

证据项 最低要求
任务与路径 当前问题,以及选择最小 / 标准 / 进阶路径的理由
运行入口 唯一开始命令、Notebook URL 或官方入口
版本 Git commit、环境、模型/数据 revision 和关键依赖
输入与来源 数据/样例来源、license、split 与必要的隐私说明
配置与唯一变量 seed、参数、Prompt、实验配置和本轮唯一改动
原始结果 未手工修改的 prediction、日志、metrics 或导出文件
指标与失败案例 主指标、切片结果及至少一个代表性失败案例
耗时与成本 预计/实际耗时、设备、GPU/云资源与费用上限或实际成本
AI 使用披露 AI 工具参与范围,以及人工核验方式
结论与下一步 当前结论、限制、仍未知问题和下一步最小验证

怎样使用

最小路径也必须记录运行入口、版本、原始结果和一个边界;标准路径以达到“可复现”或“可解释”为目标;进阶路径在相同证据基础上增加受控探索,而不是单纯增加模型规模。

五个自主阶段

阶段 怎样判断 下一步建议
未形成 只有阅读或尝试,没有稳定运行结果 缩小到一个样例和一条命令
已跑通 最小任务成功,但记录或测试不完整 补齐版本、配置、错误处理和原始输出
可复现 另一位同学能根据 README 重新运行 增加指标、失败案例和解释
可解释 能说明方法、证据、失败和限制 选择一个自主探索方向
可扩展 能提出并验证新的问题 整理公开作品或进入更深入研究

课程不要求所有学生每周都达到“可扩展”。主线达到“可复现”或“可解释”后即可继续;如果尚未达到,也不需要等待导师批准,而是在下一周优先补齐关键证据。

学习路径 建议达到的阶段 说明
最小 已跑通(证据可追溯) 可缩小模型和数据,但不能省略入口、版本、原始结果和限制
标准 可复现或可解释 完成课程主线,并能让他人按 README 检查一组结果
进阶 可解释 → 可扩展 在标准证据基础上增加单变量探索、消融或稳健性验证

每周从五个方面自查

1. 本周成果

  • 完成了本周最小可运行成果。
  • 结果与本周核心问题直接相关。
  • 没有用额外规模掩盖主线尚未跑通的问题。

2. 可复现性

  • README 提供唯一、可复制的开始命令。
  • 环境、模型、数据、配置和 seed 可追溯。
  • Notebook 从头运行,不依赖隐藏状态。

3. 证据完整性

  • 结论能回到输入、配置和原始输出。
  • 包含测试、指标或预先定义的人工检查。
  • 失败案例和负面结果没有被删除。

4. 理解与边界

  • 能用自己的话解释方法和关键设置。
  • 能区分事实、结果、解释和推测。
  • 明确写出限制、不适用场景和仍未知的问题。

5. 负责任使用

  • AI 参与范围和人工验证方式清楚。
  • 模型、论文、数据和工具均能追溯到来源。
  • 仓库没有密钥、隐私材料和不明授权数据。

自主选择下一步

  • 主线未跑通:缩小模型、数据和任务,只保留一个样例、一次运行和一个判断。
  • 已经跑通但不可复现:优先补 README、版本、配置、日志和原始结果。
  • 已经可复现:增加一个有效指标或一个有代表性的失败案例。
  • 已经可解释:从本周提供的方向中选择一个受控探索任务。
  • 已经可扩展:形成论文问题、公开项目或未来四周计划。

每周例会

例会用于交流,不是评分或验收。每位学生准备五项内容:

  1. 本周真正完成了什么;
  2. 最有说服力的证据在哪里;
  3. 最大失败或意外是什么;
  4. 选择了哪个探索方向;
  5. 下周首先准备解决什么。

导师可以听取进展、提出澄清问题、提醒研究风险和推荐官方入口,但不修改学生的自主判断,也不决定学生能否进入下一周。

最终项目自查

  • 陌生同学能从 README 复现至少一组结果。
  • 数据来源、模型 revision、配置和运行命令完整。
  • baseline、改进方法和统一评测可以公平比较。
  • 图表和结论能够由原始结果重新生成。
  • 失败、成本、限制和伦理风险被如实报告。
  • AI 使用、人工验证和个人判断清楚。
  • 后续探索问题具体、可执行、可检查。