# 已有 AI 课程的初学者审阅

审阅范围：课程大纲与第一节至第十八节课件。这里评价的是课件设计，不代表学习者已经掌握这些内容；大纲中只有第一节有明确的完成确认。

## 总体判断

这套课**适合已经懂线性回归、逻辑回归、简单神经网络和矩阵运算，且能运行基础 Python 的初学者**。从张量、训练与评估，到 PyTorch、图像、文本、Transformer、强化学习，再到知识问答，主线有递进关系。互动图解、形状追踪、可运行的小实验和自测，比只列公式更容易学；合成实验的局限也大多写明了。

它不适合作为完全零基础者的“直接顺读、每节一次学完”课程。难点主要是**一节内的新概念数量不均衡**，不是主线顺序错误。第六、七节明显比相邻课程长；第四、十五、十七节分别合并了多种不同方法。学习时应把“理解主线”和“掌握全部扩展内容”分开。

## 优先补充的内容

1. **在第二节前增加向量与矩阵求导补充课。** 学习者已经会标量求导、向量、矩阵和矩阵乘法，因此无需从一元微积分重学。补充课应从“输出和自变量各是什么形状”出发，依次讲梯度、雅可比矩阵、标量对矩阵求导、向量链式法则、全连接层的批次梯度和数值差分验证。概率、期望以及 `log` / `exp` 在后续用到时仍需短复习。这样第二节的反向传播、第六节的自动求导和第十一节的注意力矩阵计算才有共同基础。
2. **给高密度章节标出“必须会”与“先认识即可”。** 第四节先掌握决策树与模型选择，森林和提升理解思想即可，K-means/PCA 可以当作独立的无监督分支；第六节先跑通张量、自动求导和训练循环，保存加载作为下一步；第七节先学故障诊断，优化器与归一化细节随后补；第十五节以 Q-learning 为主，价值迭代、MC、TD、SARSA 用来对照；第十七节实际掌握 REINFORCE，Actor-Critic、PPO、RLHF、DPO 先会说清各自作用即可。课件已有部分边界说明，但放到每节开头会更有帮助。
3. **在第十八至二十节之间补齐最终项目的技术台阶。** 第十八节实际实现的是 TF-IDF 词面检索和原句摘录，没有训练过的语义 Embedding，也没有调用语言模型；课件对此说明准确，但大纲原先把本节写成了“Embedding 与向量检索、交给语言模型并回答”。大纲已改成与现有实验一致。如果毕业项目仍要达到“基于大语言模型的问答应用”，后续至少需要一次实际接入可运行模型的示范，以及回答与引用核查；若不接模型，则最终目标应明确改为“基于证据的检索问答”。
4. **增加一次真实数据迁移练习。** 第五节表格项目、第九节图像项目，以及语言模型和强化学习练习，大多依靠合成或极小数据集。这很适合学习机制，但不足以说明面对真实噪声、类别不平衡、分布变化时怎么办。可以在项目后各给一个小型真实数据的选做任务，沿用同样的划分、基线和错误分析流程；不用为此新增大量算法。

## 语言与讲法

前半段讲形状、广播、损失和数据泄漏时，通常遵循“直观例子 → 计算 → 代码 → 自测”，语言整体可读。第十至十三节对 Token、Embedding、Q/K/V 和玩具模型的边界解释也比较清楚。

需要收紧的主要是后半段的术语密度。例如第十五节短时间内出现“价值迭代、MC、TD、Q-learning、SARSA、on-policy、off-policy”；第十七节第二部分很快进入期望、对数概率梯度和基线推导。建议每个新术语第一次出现时先用一句日常语言解释作用，再给一个只有两三步的数字例子，最后展示公式；推导细节放进可展开的“进阶”框。每节结尾保留三道核心检查题即可，把公式推导题标为进阶。这样不会削弱准确性，也能让初学者知道卡在哪里时该先回看什么。

## 建议的学习验收

- 第一至三节：能说清张量每个轴、一次参数更新，以及训练/验证/测试各自的用途。
- 第四至九节：能独立跑通数据划分、基线、训练、评估和错误分析；能标出神经网络每层输入输出的形状。
- 第十至十三节：能追踪 Token → Embedding → 注意力 → 下一个 Token 的形状与信息流，并区分玩具字符模型和可用的大语言模型。
- 第十四至十七节：能手算一个回报和一条 Q-learning 更新，解释 DQN 的回放与目标网络，并说清 REINFORCE 学的是动作概率。
- 第十八节以后：能检查“是否检索到证据、证据是否进入上下文、答案是否被证据支持”三个不同环节；只有实际接入语言模型后，才把项目称为生成式问答。

本次已把第一至五节中的 `pip install` / 系统 Python 运行说明统一为项目的 `uv run python`，使用现有项目依赖与 uv 管理的 Python，不改变 uv 默认缓存设置。
