2026年8月 AI Agent 与 NLP / 01 OF 05

老师拿着答案讲题,学生为什么反而学偏了?

AI Agent 与 NLP 研究专题
成稿与来源补查日期 2026年9月8日 · 正文约 1,651

设想一道练习题:三盒笔,每盒八支,一共有多少支?老师看着参考解答“二十四支”,给学生演示怎样回答。学生学得很认真,尤其掌握了老师那句干脆的“显然,答案是……”。

第二天题目换了。学生仍然很干脆,答案却不对。

问题可能出在哪里?我们希望教会的是依据题目计算,学生却可能更擅长复现“已经知道答案的人怎样说话”。前者需要算,后者首先需要口气稳。

这个场景不是一份真实课堂记录。它要说明的是训练语言模型时的一种风险:提供更充分的信息,确实能让指导者答得更好;但照着这种指导学习的模型,独立使用时未必拥有同样的信息。

学一个答案,还是学怎样选择后续?

语言模型逐步生成文字,每一步会给不同的后续单位分配概率。这里的单位可能是字、词的一部分或标点,统称词元。选出一个以后,把它接回已有文字,再预测下一步。

假设学生已经写到“三盒笔,一共”。训练不仅可以告诉它最后应该答二十四,也可以给出一组指导:这里哪些后续更值得选,哪些应当降低概率。

让学生模型学习教师模型的输出分布,这类办法叫知识蒸馏。分布就是不同候选及其概率,而不只是得票最高的那个答案。于是,指导中有机会包含“第二选择是什么”“哪些选择特别不合适”之类的信息。2

教师和学生不一定是两个大小不同的模型。在自蒸馏的一些设置中,同一个模型可以承担不同角色:给其中一次计算额外材料,让它提供指导,再用指导更新模型的可调数字,也就是参数。

这时,我们不能只问老师的答案是否更好,还要问它为什么更好。

如果老师眼前多了一份参考解答,它对“二十四”的偏好可能来自看见了答案。学生眼前只有题目,却被要求形成相同偏好。这个训练信号既可能教会有用的解题关系,也可能让学生模仿依赖额外信息的表达。

三乘八当然可以独立算出。风险在于,训练怎样区分“学会算到二十四”与“学会像已经看见二十四那样接话”。

把三种信息条件分开

2026年8月3日提交的DAPD论文,中文可称“双重锚定策略蒸馏”,针对这类信息不对称改动训练目标。它并非最早指出相关风险的工作;新方案在原有蒸馏之外加入约束,协调不同信息条件下的预测。1

为看清这些条件,继续用笔的练习。假设学生先独立写出一份答案,算错成了二十七。现在把同一段尚待续写的文字,分别放进三种输入中:只有题目与已写前缀;额外看到另一份完整解答;额外看到这份待预测解答自己的全文。

第三种看起来奇怪:全文都有了,为什么还预测?因为它是训练中用于比较的计算条件,不是考试时的作答方式。我们要观察的是,有无后文、看见哪份后文,会怎样改变同一位置的预测。

DAPD保留原有的教师指导,同时让“看到自身全文”的预测分别接受两种约束:向独立作答条件下的预测靠近,也向看到另一份解答的教师预测靠近。它对参考解答与学生生成解答交换角色后,再构造相应训练。几种计算共享参数,因此这些约束共同影响独立使用时的模型。1

这里没有一条人工规则说“二十七不好,所以减三”。改变的是训练时哪些预测互相约束。参考解答提供正确性的指导,学生生成内容则反映当前模型实际会走到哪里;两者的作用不完全相同。

回到课堂类比,这更接近把“老师拿着答案的讲法”“学生当前能写出的讲法”和“独立作答时的表现”放在一起校准,而不是只奖励学生复刻老师的语气。真正执行的是概率比较与参数更新,不是另请一位班主任。

新方法有用,应该出现什么变化?

在我们的练习中,只检查学生是否更喜欢输出二十四是不够的。还可以把三盒改成四盒,让它面对没在提示里附答案的新题;或者检查原来正确的题是否被训练弄坏。

这两种检查分别追问迁移与代价。旧题答对可能只是记住了后续;新题表现改善,才能增加“它学到了可复用关系”的依据。假如新题有进步、旧题却大面积退步,也不能只挑好看的那一栏庆祝。

论文在其模型和任务设置中报告了相对基线的改善。这个结果支持继续研究信息条件匹配,并不意味着所有蒸馏方法都遇到同样程度的问题,更不意味着模型从此不会说出没有依据的话。1

还要区分“给训练多安排比较”和“给每次回答多附一份正确答案”。后者在真实问题里往往办不到:要是用户已经知道正确答案,就未必需要请助手解题了。DAPD所追求的,是让训练得到的参数在没有额外参考解答时仍更有用。

原系列讲过,用示范和反馈能改变助手的回答方式。这项8月研究补上一个更细的追问:我们提供的指导,究竟在鼓励哪一种行为?是依据现有条件完成任务,还是模仿拥有更多条件的人?

老师拿着答案讲题,本身没有问题。需要小心的是,学生最后学会的究竟是怎么算,还是怎样把“显然”说得特别显然。

参考资料

  1. Jianyu Wu、Yizhou Wang、Encheng Su、Chen Tang、Shixiang Tang,DAPD: Dual-Anchored Policy Distillation,2026年8月3日提交,8月13日修订。重点参照第2—4节。论文页面全文
  2. Geoffrey Hinton、Oriol Vinyals、Jeff Dean,Distilling the Knowledge in a Neural Network,2015。论文