从文字到行动 / 19 OF 20

现实里试错太贵,能不能先在模型里练?

NLP、Agent与世界模型的20段故事
资料核查截止 2026年9月7日 · 正文约 1,931

设想一个小车要穿过仓库,把箱子送到门口。每次失败都可能撞歪货架。老板很支持人工智能,但不打算让每次参数更新都对应一张维修单。

上一章的行动学习,可以从真实交互经验中改善策略。现在我们增加一个问题:能否先学一个环境模型,预测“在当前情况下这样做,接下来可能怎样”,再利用这些预测训练行动?

这类研究里的世界模型,并不是把整个宇宙塞进电脑。它首先是针对所处理环境与信息,学习状态怎样随动作变化的模型。名字管得很宽,能预测什么,仍由训练内容和检验结果决定。

先学“会发生什么”,再学“应该做什么”

在仓库设想中,先记录实际经历:当前画面、转弯或前进的动作、随后画面,以及与任务有关的反馈。预测模型可以用这些记录学习从当前情况与动作推到后续情况。

动作不能省略。同样面对货架,选择前进与后退,后果可能不同。若模型只学“一般接下来出现什么画面”,却不以动作作为条件,就难以回答我们真正关心的比较。

2018年,David Ha与Jürgen Schmidhuber的《World Models》展示了一种把观察压缩、动态预测和行动控制分开的研究方案。其视觉部分将图像变成紧凑表示,循环预测部分结合表示、动作和历史预测后续,控制器则利用这些信息选择动作。1

这里可以看见本系列的旧朋友:数字表示、循环状态、训练。世界模型并不是等到聊天模型流行以后才出现的想法,也不要求每个部分都使用Transformer。

在我们的例子中,环境模型回答“右转可能进入过道”,策略回答“为了送箱子,现在选右转”。即使两者放在同一套系统里,也要分清工作。天气预报说有雨,与你决定带伞,是相互有关的两件事。

“在想象里练习”,不是必须播放一部高清电影

直接预测每个像素很费力,而控制所需的信息可能集中在位置、运动和障碍关系上。潜在表示,就是模型内部学到的紧凑数字状态;它不必与人命名的“坐标”“速度”逐格对应。

设想我们已经从仓库画面得到一个内部状态。让模型输入“右转”,预测下一状态;再输入“前进”,继续预测。这样可以在没有实际移动小车的情况下,形成一段候选轨迹。轨迹是按顺序连接的状态与动作,并非一条装饰性的路线图。

2019年公布、发表于2020年会议的Dreamer,把这类潜在空间中的预测用于学习行为。它学习环境动态与奖励相关预测,再在想象出的轨迹上训练动作模型和价值模型,最后回到实际环境收集新经验。2

为什么需要价值模型?预测通常只展开有限步,任务却可能更长。价值估计用来评价展开范围之外的后续收益,帮助行动学习不只盯着眼前几步。

在仓库里,某条路径前几步离门口更远,却绕开了货架。若只看短期距离,小车可能拒绝绕路;结合后续价值,绕路就可能成为值得学习的选择。路线最终是否学对,要回实际任务检验。

训练期间可以在紧凑状态里计算,无须每次都生成供人观赏的清晰视频。把状态解码成画面,常是为了观察模型表现。小车练习搬货,不必给每次练习配导演和调色师。

模拟器也会被自己的学生钻空子

问题很快出现:模型预测可能错,而策略会主动寻找高回报的做法。一个小预测漏洞,可能被反复利用。

《World Models》的作者报告过这样的现象:在其学出的虚拟射击环境中,控制器找到某些行为,使预测环境中的怪物不再正常发射火球。这种策略在模型里得利,却不代表在真实游戏中也成立。1

回到仓库设想:如果模型错误地认为货架边角可以穿过去,策略可能学出一条漂亮近路。在模拟里节约时间,在现场更换保险杠。它不需要有“作弊”的心理,只要优化目标偏爱这条错误预测出来的路径。

还有误差积累。第一步把位置预测偏一点,第二步以偏了的位置为输入,后面可能越走越远。策略进入训练数据很少覆盖的区域时,模型也可能尤其不可靠。

因此,预测图片好看、单步误差较小、训练策略得分高,都不能各自充当最终保证。应该检查与目标有关的动作后果,以及策略回到实际环境后的表现。增加随机性、改善数据覆盖、继续收集经验等办法能够帮助处理问题,但没有一种简单开关能让错误消失。1 2

比起无模型方法,这条路线增加了可利用的预测,同时也增加了必须管理的模型误差。它是一项取舍,不是宣布真实试错从此退休。

从能用一次,到更容易在不同任务中用

设想仓库换了一个版本:奖励从送达加1改为加100,动作从左右按钮改为连续转向角度。学习算法如果每遇到变化就需要专家大改设置,应用成本仍然很高。

Dreamer第三代研究关注的一项问题,就是怎样让同一算法设置更稳健地用于不同环境与奖励尺度。论文采用数值变换、归一化及训练目标平衡等设计,减少跨任务调参负担。3

这里的设置通常叫超参数,例如训练中某项损失占多大权重;它们与通过训练得到的模型参数不同。相同超参数在多个任务有效,也不意味着同一份已训练权重无需新经验就能驾驶所有仓库的小车。

这项发展把问题从“能否靠预测学习”推进到“这套办法是否足够稳健、便于复用”。后续研究还会增加模型规模、使用离线视频,并尝试更复杂的交互环境;但复杂画面不会免除动作检验。

标题的答案是:可以先在学出的模型里练习。先用经验学习环境如何变化,再在预测轨迹中学习行动,能减少部分直接交互的需求;收益取决于预测对任务是否足够可靠,以及如何处理错误和数据覆盖。

老板可以少付一些维修费,但不能把真实仓库的验收员全部换成模型里的虚拟同事。

最后一篇,我们将面对更容易让人惊叹的展示:一个可以实时走进去、转身、探索的生成世界。画面已经动起来了,接下来该怎样判断它究竟掌握了多少规律?

参考资料

  1. World Models,David Ha、Jürgen Schmidhuber,2018。作者研究全文与演示
  2. Dream to Control: Learning Behaviors by Latent Imagination,Danijar Hafner、Timothy Lillicrap、Jimmy Ba、Mohammad Norouzi,预印本2019,ICLR 2020。论文
  3. Mastering Diverse Domains through World Models,Danijar Hafner、Jurgis Pasukonis、Jimmy Ba、Timothy Lillicrap,DreamerV3,预印本2023。论文