从文字到行动 / 10 OF 20

接着写下去,怎么写出了翻译和代码?

NLP、Agent与世界模型的20段故事
资料核查截止 2026年9月7日 · 正文约 1,728

设想我们在纸上写:“猫 → cat;狗 → dog;书 →”。只要掌握这些词的中英文对应,读者很容易补出book。这个任务表面上是接下去写,实际上在要求翻译。

再换一张纸:“太感谢了 → 表扬;等了三个月 → 投诉;工作人员帮我找回了书 →”。表面的操作仍是续写,但接下来的答案,要符合前面示范的分类方式。

这提出了一个问题:如果续写模型在训练中见过足够多的任务结构,能不能通过当前提示判断“这一轮应该做哪种事”?

2020年的GPT-3论文系统研究了这种使用方式:在输入中给出任务描述与少量示例,不为每个任务另做参数更新,再观察后续表现。1

范例进入前文,不是当场改造大脑

在我们的中英对照例子里,模型把整段提示作为条件,计算“书 →”后面各个词元的概率。前文给出的箭头、语言对应和格式,会影响当前计算,因此影响后续选择。

这种利用输入范例适应任务的现象,通常叫上下文学习。此处“学习”很容易与第五篇的训练混淆:第五篇用损失与梯度修改参数;现在,参数可以保持不变,变化的是参与本轮计算的输入及内部状态。1

设想同一模型前一轮看到中英翻译,后一轮看到“猫 → 动物;桌子 → 家具”,它可能转而给“狗”输出“动物”。这不能证明每次提示都永久写入模型参数。更像把不同试卷放到同一个已训练的答题系统面前,题目变了,计算结果随之改变。

给零个、一两个或更多范例,会形成不同测试条件。论文中的“少样本”不能理解为模型一生只见过几句语言:它此前已经接受大量预训练,只是当前任务的示例数量少。

否则,一个人读完图书馆再看两张范例,也可以宣称自己“两分钟学会英语”。图书馆可能第一个不同意。

任务为什么能装进一段续写?

原来我们把预测理解为补一个词。现在看整个序列,它可以包含问题、示范、说明和答案。想接得合理,有时就得利用翻译关系、类别边界或步骤规则。

设想一份文字材料正在解释怎样计算购物总价,后面附有程序。程序语言虽然能执行,写在文件里也首先是一串有结构的符号:什么位置能出现名称、括号怎样配对、前面定义的内容怎样被后面引用,都存在可学习的规律。

续写目标因而可以训练出对这些结构有用的能力。不过,“能生成像样的程序”与“程序解决了当前问题”之间仍隔着运行、环境和测试。这里解释的是任务为何能进入统一文本接口,不是证明所有任务都能靠文字样式解决。

GPT-3的论文展示了多种任务上的上下文表现,也记录了局限,包括有些比较、推理与长文本一致性任务仍然困难。1

规模扩大后,多任务使用方式更有吸引力,但“只要接龙,就必然自动掌握一切”不是论文替我们盖过章的结论。一个能续写维修手册的系统,暂时还没有亲手拧过螺丝。

把模型做大,钱应该花在哪里?

第五篇已经解释过参数。更多参数意味着更多可调节的计算自由度,但这些自由度需要资料与训练来形成有用结构。还有一项不能忽略:执行这些计算所需的算力预算。

设想我们只有一笔固定预算。可以买更大的模型,但每个参数训练得较少;也可以用较小模型,处理更多训练文本。哪种更好,不能只看产品海报上哪个数字长。

2022年的Chinchilla研究就把问题设为:在给定训练计算预算下,参数规模与训练词元数量怎样配合?研究者比较不同规模与数据量的训练结果,发现当时一些大模型相对缺少训练数据,并用Chinchilla验证了不同预算分配的收益。2

这里的词元数量指训练实际处理的单位数量,不等于独立事实的条数。把同一页复印很多遍,与增加同样篇幅的新材料,信息价值也不相同。资料质量、重复、领域覆盖、模型结构与优化方式都会影响结果。

因此不能把论文中的经验比例变成跨越所有时代的采购法则。尤其如果还要考虑模型部署后回答海量请求的成本,最佳取舍可能不同于只考虑一次训练预算。

参数、数据与算力是一起做饭的条件。锅越来越大,米却不增加,不能靠宣布“千亿粒级锅具”让大家吃饱。

看起来多才多艺以后,还缺什么?

设想你输入“帮我把这段通知改成一句话”,模型却继续写:“再翻译成英文,最后发给同事。”对于某些文本上下文,这可能是合理的句子续写;对于真实用户,它完全没干活。

这个例子揭示了下一步需要改变的目标。预训练让模型具备许多可调用的规律,上下文示范帮助它判断当前模式,但“像文档一样接下去”和“像助手一样完成请求”不总是同一件事。2022年的InstructGPT工作明确把这种差距作为训练问题。3

前面的翻译范例已经预先摆好任务格式。普通用户未必会提供这么整齐的试卷,问题也可能含糊、冲突或缺少条件。接下来,需要更有针对性的训练,让模型更稳定地按照任务要求回答,并学习哪些回答更值得选择。

标题的答案是:续写可以承载翻译、分类和代码等结构;大量预训练让模型学到可复用的规律,当前上下文又能指定其中一些用法。规模是重要条件,但与数据、计算和训练目标共同起作用。

我们得到了一位能参加许多考试的选手。下一步,要教它识别哪句话是试卷,哪句话是用户在叫它办事。

参考资料

  1. Language Models are Few-Shot Learners,Tom B. Brown等,2020。论文
  2. Training Compute-Optimal Large Language Models,Jordan Hoffmann等,2022。论文
  3. Training language models to follow instructions with human feedback,Long Ouyang等,2022。论文