2026年8月 AI Agent 与 NLP / 04 OF 05

换一张工作台,AI就能把长任务做得更好吗?

AI Agent 与 NLP 研究专题
成稿与来源补查日期 2026年9月8日 · 正文约 1,927

2026年8月的Prime Agent技术报告,把改进目标放在了模型周围的工作系统:保存计算状态,保留历史与经验,组织子任务,让执行结果能够进入后续决策。这里的一些变化可以在模型权重不变时发生。1

这提出了一个容易被模型排行榜遮住的问题:同一个模型,换一种取得资料、执行操作和接续任务的办法,会不会表现不同?

人在厨房里做饭,菜谱背得再熟,也不能把刚算好的配料比例写在一块随时被擦掉的黑板上。第二锅重算一次,第三锅再重算一次,熟练工最终可能把主要精力用来证明自己刚才确实算过。

Agent的长期工作也有类似困难。Agent在这里指围绕目标选择动作、使用工具并根据反馈继续处理的系统。要让它持续办事,不能只关注每一轮回答好不好,还要看几轮之间留下了什么。

当前能看见,与系统曾经保存,是两回事

设想一家连锁小店请助手核对一个月的订单:统计各店实收金额,扣除退款,再找出异常记录。

原始表很长。第一轮,助手发现“已取消”订单不计入实收,又算完甲店的小计。第二轮继续乙店时,如果当前输入只剩“已处理甲店”,它既不知道小计多少,也不知道取消订单为何被排除。

完整聊天也许还躺在系统里,但模型这一轮没有读到它。保存和使用之间,缺了一次明确取回。

最粗糙的处理,是每次把整张表、全部对话、所有计算结果一起塞进输入。这样虽然看起来保险,却不断增加阅读和计算负担。记录越长,重要条件也越容易被大量无关输出淹没。

另一种安排是分开保存:原始表留在文件中,计算过的表格与中间结果留在执行环境里,本轮输入只带要处理的任务、必要规则,以及刚刚取回的相关结果。

这时,模型必须通过读取或查询真正取得材料,不能仅凭“文件大概在那里”就视为知道内容。文件柜存在,不会自动让柜台上的人拥有每份文件的全部信息。

把算过的结果留在工作台上

Prime Agent采用持久的交互式计算环境,并把当前输入之外的历史、记忆、技能等状态纳入管理。系统让模型通过程序处理资料,再把选中的结果送回当前输入;完整记录不必每轮全部重新展开。1

在小店设想里,可以先将订单按门店分组,计算甲店的小计,保留结果;下一步直接处理乙店。遇到一笔有争议的退款,则按订单编号回查原始记录。

这里最有价值的不是“记住更多字”,而是把信息放在能定位、能读取、能继续计算的位置。门店小计不用靠一段自然语言描述维持,原始依据也不必因为摘要写好了就消失。

但持久并不等于永远有效。如果用户随后上传修正版订单,旧小计就可能失效。记录还需要说明它依据哪份数据产生,否则错误会从“忘了算过”变成“坚信昨天算过”。

两种错误都很勤劳,只是浪费时间的方向不同。

分给几个助手,账就会自动平吗?

仍是这个任务。甲店和乙店可以分别统计,只要大家使用同一规则,返回能合并的结果。

如果甲店助手扣了退款,乙店助手没扣,最后将两个数字相加,算术完全正确,报表照样错误。因此,子任务需要取得相同口径,也要返回结果的适用范围,不能只交一个看起来很整齐的数字。

Prime Agent支持递归子任务及直接通信,并将相关执行、消息和资源使用记录下来。这让模型有办法组织多个工作过程;它并没有替每一项实际任务预先证明怎样分工最合适。1

在小店里,一种可检查的交接可以包括:使用的原始表版本、排除条件、实收小计、未能确认的订单。汇总者据此决定能否相加,遇到口径不同先修正。

分工的收益来自独立部分能同时推进;代价包括重复读取、沟通和核对。如果只有三笔订单,先开一次分工会再开一次汇总会,可能比直接算完还费事。

自我改进,究竟改在哪里?

假如这次核对发现,经常出错的是把“退款申请中”当成“退款已完成”。助手可以把正确区分写进后续会读取的说明,也可以保存一个检查程序。

下一次遇到同类任务,系统取回说明或调用程序,行为便可能变化。这属于外部经验得到复用。只有发生相应训练更新,模型参数才会因此改变;修改一份说明文档,不能自动算作训练了一个新模型。

Prime Agent所称的一类自我改进,正是将执行经验转化为可修订的外部状态。论文同时保留版本与来源,方便追溯和回退。1

这仍然需要判断经验是否可靠。如果某次误判被总结成“所有申请退款都应该扣掉”,持久保存只会让下一次更稳定地扣错。记忆不负责把猜测变成事实,技能名称也不能替程序验收。

换了工作台,怎样知道真的更好?

对我们的报表任务,至少要比较最终金额是否正确、漏掉了哪些异常、耗时与调用成本如何。还要看中断后能否恢复,以及恢复后有没有重复记账。

比较时尽量固定模型、原始数据、任务要求和预算。如果一边允许反复运行许多小时,另一边很快截止,单看最终正确率就不能把差异全归给工作系统。

Prime Agent论文也明确指出,部分外部官方成绩与它自己的复跑结果不能充当严格隔离工作系统影响的对照。因此,本篇不拿一个大幅上涨的摘要数字,替所有任务作保证。1

这项研究给长任务带来的重要视角,是把失败位置拆开:模型是否作出了错误判断,资料是否进入当前输入,工具是否执行成功,状态是否丢失,结束是否太早。不同问题需要不同修补。

换工作台确实可能改变AI完成任务的能力范围,因为它改变了可利用的信息与操作。但工作台不能代替每一次判断,也不能把一份没对上的账单,靠保留得更久变成正确答案。

该保存的小计要保存,该重新核对的旧结果也要重新核对。厨房里的黑板不用每锅擦一次,但菜谱更新以后,也不能继续照着旧配方下盐。

参考资料

  1. Seth Karten、Alex L. Zhang、Kevin Thomas等,Prime Agent: A Self-Improving RLM Harness,arXiv于2026年8月24日提交,作者全文另署首次发布于8月5日。重点参照第2节架构与第3.1节比较条件。论文页面全文