听完演讲后,我一直在想一个问题

今天的大模型已经足够让人惊讶。它可以写文章、生成图片、编写代码,也可以在几秒钟内整理一份复杂资料。很多过去只有专业人士才能完成的工作,现在只需要一段提示词。但听完Richard Sutton的演讲后,我脑子里留下的并不是这些已经实现的能力,而是另一个问题:现在的AI很会回答问题,但它真的会在世界中持续成长吗?

2026年7月19日上午,2024年图灵奖得主Richard S. Sutton出席WAIC思想者论坛,围绕"从经验中学习"以及更通用的智能体架构进行了分享。此前在7月17日的WAIC主论坛上,他也提出,AI正在从主要依赖人类已有数据的阶段,走向更加重视环境交互和第一视角经验的"经验时代"。Sutton与Andrew Barto因奠定强化学习的概念和算法基础,共同获得2024年ACM图灵奖。他长期研究的核心问题并不只是如何让机器完成某项任务,而是如何从智能体与环境的互动出发,解释学习、预测、决策和目标导向行为。这也是为什么,他谈论AI时,总会把问题重新拉回几个看似基础的词:动作、观察、状态、奖励、价值、知识。这些词没有"万亿参数"那么醒目,却可能更接近智能最底层的结构。

一、智能不只是知道得多,而是能够通过行动不断修正自己

现在的大语言模型主要从大量已有数据中学习。它们读过人类写下的书、网页、代码、对话和各种公开资料,因此能够复现非常复杂的语言模式,也能够组合出看起来很有创造力的答案。但Sutton更关心的是另一种学习:一个智能体进入环境,采取行动,看到结果,获得反馈,然后调整下一次行为。这个过程里,知识不是被一次性"装进系统"的,而是在持续互动中形成的。

强化学习关注的正是这种循环:智能体采取动作,环境发生变化,智能体获得新的观察和奖励,再据此调整自己的行为。在Sutton提出的通用智能体框架中,智能体内部至少需要处理感知、策略、价值判断和对状态变化的预测。它不仅要回答"现在看到了什么",还需要判断"现在的处境意味着什么""接下来可能发生什么""长期来看什么选择更好"。这与我们今天最熟悉的大模型使用方式存在明显差别。

一次普通的大模型对话通常是:用户提出问题,模型根据已有参数和检索到的资料生成答案,对话结束。而Sutton设想的智能体更像一个长期存在的学习者:它拥有持续的经历,会面对行为后果,会形成新的预测,也会因为世界发生变化而更新过去的认识。换句话说:真正困难的可能不是让AI回答更多问题,而是让它在一个不断变化的世界里,持续知道自己处于什么状态,哪些认识已经过时,下一步应该做什么。

二、"状态"不是世界本身,而是智能体对自身处境的理解

演讲中有一个很重要的概念:状态表示。智能体无法完整接触世界的全部信息。即使是人,也不可能同时知道一座城市里每辆车的位置、每个人的想法以及下一分钟会发生什么。我们只能根据已经看到、听到和经历过的内容,形成对当前处境的有限理解。因此,状态并不是世界的完整复制。它更像是智能体在当前时刻对"我在哪里、正在发生什么、哪些信息重要"的内部描述。

这个状态可能由大量特征组成:我正在一个会议现场;台上的人正在讨论强化学习;某个概念与我正在研究的Agent有关;这条信息值得进一步记录;我之前的某个判断可能需要调整。这些特征组合起来,形成智能体对当前处境的理解。原始纪要中也将感知描述为把当前及历史观察、动作转化为状态表示,并由大量特征共同描述智能体所处的情境。

这给我一个很直接的启发:很多人把智能理解为拥有更多知识,但从智能体角度看,更重要的也许是:在具体情境中,能否找到真正重要的特征。同样一段信息,对不同的人意义完全不同。有人听完一场演讲,只记住了嘉宾身份和几个金句;有人可能从中发现一个研究问题;另一个人则可能意识到自己原来的技术路线存在缺口。差别不只是"谁记住得更多",而是谁形成了更有用的状态表示。

三、价值函数让智能体看到行动的长期后果

如果一个系统只能判断眼前发生了什么,它仍然很难完成复杂决策。智能还需要回答另一个问题:当前状态从长期来看是好还是坏?这就是价值函数的作用。即时奖励通常很容易理解。吃一块蛋糕可能带来愉悦,完成一项工作可能获得收入,机器人碰到障碍物可能得到负面反馈。但复杂决策不能只看眼前。

蛋糕的即时体验可能很好,长期后果却未必符合目标;某个短期看起来麻烦的选择,也可能在未来带来更大的收益。价值函数试图估计的,正是一个状态或选择在未来一段时间内可能产生的累积结果,而不只是眼前的一次奖励。这也是强化学习与普通模式识别之间一个很重要的区别。识别系统更关心:这是什么?决策系统则需要继续追问:如果我这样做,接下来会发生什么?这些后果与我的目标是否一致?

当AI从回答问题走向执行任务,这种长期价值判断会越来越重要。今天很多Agent已经可以调用工具、搜索网页、发送信息和操作软件,但"能调用工具"并不等于"知道什么时候应该调用、调用之后如何判断结果、失败后如何调整"。工具调用只是动作。真正的智能还需要状态、目标、价值和对后果的理解。

四、Options:智能体如何把动作逐渐变成技能

演讲中另一个值得关注的概念是Options。中文通常可以翻译为"选项",但它并不是选择题里的选项,而是一种能够持续一段时间的高层行为策略。一次最基础的动作可能只是:抬起手;向前移动一步;点击一个按钮。而一个Option可以是:走到会议室门口;完成一次资料搜索;返回酒店;写完一篇文章;检查一个品牌在多个大模型中的回答结果。

这些任务都不是一个瞬间动作,而是由很多底层动作组成的连续过程。在经典Options框架中,Option通常包含一套内部策略、适用条件和终止条件。它让智能体能够在更长的时间尺度上进行学习和规划,而不是永远停留在最细小的动作层面。Sutton等人的研究表明,Options可以作为具有时间跨度的行为单元,参与学习、预测和规划。可以把它理解为:动作解决"下一步怎么做",Option解决"接下来这一段时间我要完成什么"。

人类的很多能力也是这样形成的。刚学开车时,每个动作都需要刻意思考;熟练之后,"变道""停车""通过路口"会逐渐成为更完整的技能单元。一旦形成这些高层技能,我们就不必每一次都从最底层重新规划。这也意味着,一个真正能够持续成长的智能体,不能只有一组固定动作。它还需要不断把经验组织成新的技能,并在未来任务中重新组合这些技能。

五、OaK:从特征出发,形成子问题、技能和知识

Sutton进一步介绍了Options and Knowledge Architecture,简称OaK,即"选项与知识架构"。这套架构最吸引我的地方,不是它给出了一张固定的系统结构图,而是它试图解释:一个智能体如何不断为自己创造新的学习问题。大致过程可以理解为:智能体在经验中形成新的状态特征;从中筛选值得关注的特征;围绕这些特征创建子问题;学习解决子问题的策略;将这些策略形成可以反复使用的Options;学习这些Options会把自己带到什么状态;利用这些知识进行更高层的规划;在新的经验中继续发现特征和问题。

例如,一个婴儿偶然听见拨浪鼓发出声音。"出现了某种声音"可能成为一个新特征。随后,婴儿开始探索:我怎样才能让这个声音再次出现?在反复动作和反馈中,它可能逐渐学会摇动手臂,并把这种行为形成一种可复用的技能。从这个角度看,智能不是把所有可能的问题提前写好,而是:在与世界互动的过程中,自己发现什么值得学习。原纪要将这一过程概括为"特征—子问题—选项—转移模型—规划—新特征"的循环。上海交通大学对Sutton近期研讨内容的整理也指出,OaK从状态特征出发形成子问题,通过解决子问题获得Options,再学习这些Options带来的高层状态变化,从而构成不断扩展的开放式学习过程。

这里所说的"知识",也不一定是对世界进行像素级、物理级的完整模拟。很多时候,人类真正用于规划的知识是高层的:走出会场之后可以打车回酒店;写完文章之后需要检查事实来源;网站发布内容之后,需要观察是否被搜索引擎收录;一个品牌信息出现冲突时,需要回到原始资料核验。我们不会在做这些决策时模拟每一个空气分子的运动。我们关心的是:执行一个行为之后,整体状态可能发生什么变化。这是一种可以用于行动和规划的知识。

六、真正困难的不是学习一次,而是持续学习

听到这里,OaK似乎提供了一条非常自然的智能成长路线:发现特征、提出问题、学习技能、形成知识,然后继续发现新的特征。但真正的困难也在这里。现在的深度学习系统非常擅长在一个相对固定的数据集和目标上完成训练,却未必擅长长期、连续地学习。一个系统学习新任务时,可能破坏过去已经掌握的能力,这通常被称为灾难性遗忘;随着训练持续进行,网络也可能逐渐失去吸收新知识的能力,即可塑性下降。

这和人的现实体验其实很像。学习不是把新内容不断堆进一个无限空间。我们的时间、注意力和记忆都有限,因此必须不断决定:什么值得记住;什么已经过时;哪些知识应该保留;哪些能力需要加强;有限的资源应该用于解决什么问题。如果AI要成为长期运行的智能体,它也必须面对这些问题。它不能每出现一个新任务,就从头训练一套新模型;也不能无限保留所有历史数据;更不能因为学会了新东西,就把过去有价值的能力全部覆盖。

所以,Sutton的架构并不是在宣布一个已经完成的超级智能方案。相反,它更像是在明确指出:通往持续学习智能体的关键组件已经逐渐清晰,但其中最困难的问题仍远未解决。

七、这场演讲并不是在宣布"大模型已经过时"

讨论Sutton的观点时,很容易走向另一个极端:大模型依靠人类数据,所以大模型没有价值;强化学习依靠经验,所以强化学习才是唯一正确路线。我认为这种理解过于简单。今天的大语言模型已经证明,大规模预训练可以形成极其强大的语言、知识组织和泛化能力。它们能够处理过去很难由单一系统完成的大量任务。Sutton提醒我们的,不是这些能力不存在,而是:使用人类已经积累的知识,与智能体自己在世界中发现和验证新知识,不是完全相同的能力。

大模型擅长从已有资料中总结一个答案。长期智能体则还需要:保持持续状态;面对真实行动后果;从反馈中修正策略;形成可复用技能;识别环境变化;长期管理记忆和计算资源;在没有人为预设全部任务时发现新问题。未来更可能出现的,不是"大模型"和"强化学习"二选一,而是语言模型、环境交互、工具使用、记忆、规划和持续学习之间更深的结合。

八、从智能体理解世界,到大模型理解一个品牌

Sutton的演讲并没有讨论GEO。下面这一部分,是我从演讲出发产生的延伸思考。Sutton关注的是:智能体如何通过经验形成对世界的理解。而我们在aigeo.guru长期研究的是:大模型正在如何形成对一家企业、一个品牌和一个人的理解。两者当然不是同一个技术问题,但有一个相似之处:信息存在,不等于理解已经形成。

一家企业可能有官方网站、公众号、新闻报道、产品文档、百科介绍和大量社交媒体内容。但这些内容如果彼此矛盾、长期不更新、缺少清晰定义,或者无法回答用户真正关心的问题,大模型最终形成的品牌认知就可能是模糊的、片面的,甚至错误的。因此,GEO不能只理解为"多写文章,让AI看见"。真正需要建设的是一套相对稳定的品牌知识结构:企业是谁;主要解决什么问题;产品适合哪些场景;与其他方案有什么差异;哪些信息来自企业官方;哪些结论有第三方证据;信息发生变化后,如何及时修订;用户提出不同问题时,答案能否保持一致。

从这个角度看,品牌内容也不是越多越好。更重要的是:让分散的信息逐渐形成清晰、可验证、相互连接的知识。这也是我们对GEO的理解。我们在《GEO 不是公关,而是证据链》中详细讨论过:品牌知识结构的核心不是内容数量,而是清晰度、可验证性与相互连接。我们不把GEO简单理解为"给AI刷排名",而是帮助企业建立更准确、更稳定、更容易被大模型理解和引用的品牌知识体系。

九、听完Sutton,我对"智能"有了三个新的理解

  1. 智能不是静态能力,而是持续变化的过程。一个系统在某次测试里得分很高,并不代表它已经具备长期适应世界的能力。真正的智能还要面对时间、变化、资源限制和行动后果。
  2. 知识的价值,最终要回到行动和预测。知识不是存储了多少文本,而是能否帮助系统预测未来、选择行为,并在结果不符合预期时修正自己。
  3. 未来的Agent不能只会调用工具。调用搜索、浏览器、代码和企业系统只是开始。更重要的是,Agent能否记住过去发生了什么,判断当前处境,形成可复用技能,并在长期运行中持续改进。这条路显然还很长。但也正因为如此,Sutton的演讲值得被认真讨论。

当行业的注意力集中在模型参数、榜单成绩和新产品发布时,他把问题重新拉回了智能的起点:智能体如何在世界中行动,又如何从行动的后果中不断改变自己?这或许比"下一个模型会有多大"更难回答,也可能更加重要。

关于 aigeo.guru

aigeo.guru是一个专注于生成式引擎优化、AI信源与大模型品牌认知研究的平台。我们研究大模型如何理解、引用和推荐一个品牌,并通过品牌知识库建设、高价值问题梳理、公开信源建设、模型认知测试和持续校正,帮助企业形成更准确、更稳定、更容易被大模型理解和引用的数字知识资产。

本文根据2026世界人工智能大会相关演讲、公开研究资料与现场纪要整理。文中关于Sutton研究和演讲内容的描述,与aigeo.guru的延伸分析进行了明确区分。