生成式AI 的中局范式:从Harness 到Experience Loop

本文来自微信公众号: AIGC从0到1 ,作者:王零壹,原文标题:《生成式 AI 的中局范式:从 Harness 到 Experience Loop》 过去几年,生成式AI行业一直在寻找下一个足以改写叙事的大词。
有人说是更大的模型,有人说是推理,有人说是Agent,有人说是世界模型,也有人已经把目光投向“自我改进”“递归自我提升”。
但如果把这些概念拆开,会发现:2026年的行业未必已经出现了“Transformer 2.0”式的新底座;真正逐渐收敛的,是一套比“模型能力”更完整的系统观。
它大致包括三个层面的变化: 在产品上,AI正从“帮你用软件”,走向“替你交付工作”; 在产品上,AI正从“帮你用软件”,走向“替你交付工作”; 在系统上,模型不再独自构成产品,模型之外需要一个持续运行、可行动、可验证的Runtime; 在系统上,模型不再独自构成产品,模型之外需要一个持续运行、可行动、可验证的Runtime; 在学习上,行业开始从“依赖人类数据训练模型”,走向“让系统在环境中积累经验,并把经验转化为能力”。
在学习上,行业开始从“依赖人类数据训练模型”,走向“让系统在环境中积累经验,并把经验转化为能力”。
如果一定要写成一个公式,今天越来越多AI系统接近的是: AI System=Model+Persistent Runtime+Environment+State/Memory+Verification+Learning Loop AI System=Model+Persistent Runtime+Environment+State/Memory+Verification+Learning Loop 或者更直白一点: Goal→Act→World→Feedback→Update→Act Again Goal→Act→World→Feedback→Update→Act Again ChatGPT时代的基本链路是:提示词,生成答案。
成熟Agent系统的链路则变成:目标,执行,进入环境,获得结果,接受评估,沉淀经验,再次行动。讨论的是:AI如何从一次性推理,变成一个持续存在于真实世界里的系统。一、先别把五层问题混成一场路线之争 今天关于Agent、Harness、Agent OS、Continual Learning、World Model的争论,常常显得混乱。
原因不复杂:大家讨论的根本不是同一层问题。
层级 讨论的问题 代表性方向 模型层 智能从哪里来 Scaling、推理、多模态、世界模型 系统层 模型如何真正行动 Model+Harness/Runtime 学习层 系统如何变得更好 经验、记忆、技能、持续学习 产品层 用户究竟买到什么 Copilot、Agent、AI Worker 产业层 AI在经济中扮演什么角色 软件工具、数字员工、软件即劳动力 这五层会相互影响,但不能互相替代。
例如,腾讯WorkBuddy、阿里QwenWork、Grok Bot等产品的意义,在于它们把AI产品的交付单位,从“回答”推进到了“任务成果”。微软对Copilot的表达也经历了类似变化:从“帮我找到”,到“帮我选择”,再到“替我完成”。这是一种很重要的产品迁移:软件开始从工具,走向劳动力。
但“软件即劳动力”不是模型自动出现的结果。模型能思考、能生成,不等于它拥有身份、权限、记忆、工作现场、操作记录与责任边界。
那些问题,属于运行时。二、Agent的关键,不只是模型,而是它运行在哪个世界里 DeepSeek在DSH中给出了一个非常清晰的表达: Agent=Model+Harness Agent=Model+Harness 其中,模型负责智能;Harness负责让智能能够完成任务。
DeepSeek的做法尤其值得注意:模型、工具、技能、会话、沙箱、存储、循环、调度和UI,都可以被视为可替换的插件。核心保持很薄,外围不断替换和组合。这意味着,Harness不是一个写死的Agent工作流。
它更像一个可以持续被检验、替换、重放、恢复、分叉和优化的运行环境。Agent不只是“调用几个工具”,而是在一个可观察的系统中工作:它有轨迹,有日志,有状态,也需要面对失败。Anthropic在其面向托管Agent的实践中,也提出了一个很现实的判断:许多Harness本质上编码了“模型做不到什么”的旧假设。
模型变强后,这些经验性补丁可能反而成为约束。这正是当下系统设计最微妙的地方。模型能力增强,会吞掉一部分Harness。
但它不会吞掉全部Harness。会被模型逐渐吞掉的,是认知层的脚手架: 硬编码的规划逻辑; 硬编码的规划逻辑; 提示词技巧; 提示词技巧; 固定决策树; 固定决策树; 简单的工具路由; 简单的工具路由; 机械式重试; 机械式重试; 为弱模型设计的大量上下文补丁。为弱模型设计的大量上下文补丁。
模型越强,越不需要人类替它规定“应该先想什么、再想什么”。但另一部分东西,不会因为模型更聪明而消失: 身份与权限; 身份与权限; 沙箱与隔离; 沙箱与隔离; 长期状态; 长期状态; 外部记忆; 外部记忆; 工具契约; 工具契约; 审计日志; 审计日志; 成本控制; 成本控制; 验证机制; 验证机制; 安全与治理边界。
安全与治理边界。这些不是认知问题,而是现实世界的问题。模型可以决定“下一步应该做什么”;但模型不能自己决定“它是否有资格做这一步”。所以,未来更可能发生的变化是: 认知脚手架会逐渐消失,行动基础设施会越来越厚。
认知脚手架会逐渐消失,行动基础设施会越来越厚。也可以写成一句更短的话: Cognitive Harness变薄,Operational Runtime变厚。Cognitive Harness变薄,Operational Runtime变厚。
很多所谓Agent OS,最后未必会成为“AI的Windows”或“AI的Android”。它更可能变成非人类行动者的运行环境:管理状态、身份、权限、资源、工具、沟通、记录和评估。它不是智能本身,但它决定智能能否被安全、稳定、长期地使用。
三、Harness是今天最成熟的答案,但它还不是终局 如果只看2026年已经被证明有效的部分,Model+Harness几乎是最清晰的系统范式。因为模型再强,也需要被接入环境。一个能完成复杂工作的Agent,至少需要回答这些问题: 它能看见什么?
它能看见什么?它可以调用哪些工具?它可以调用哪些工具?它有没有权限修改数据、发邮件、下单或部署代码?它有没有权限修改数据、发邮件、下单或部署代码?
中途失败后,能否恢复?中途失败后,能否恢复?多轮任务结束后,是否还记得此前发生过什么?多轮任务结束后,是否还记得此前发生过什么?
它的动作能否被追溯?它的动作能否被追溯?谁来判定它完成得对不对?谁来判定它完成得对不对?这些问题的答案,构成了Runtime。
所以,今天的Agent成熟度,不只看模型benchmark,也要看运行时是否具备“持续工作的条件”。
一个较完整的Agent系统,可以写成: Agent=Model+Runtime+Environment+Memory+Verifier+Learning Loop Agent=Model+Runtime+Environment+Memory+Verifier+Learning Loop 其中: Model提供通用智能与推理能力; Model提供通用智能与推理能力; Runtime提供编排、身份、权限和持久状态; Runtime提供编排、身份、权限和持久状态; Environment提供任务、工具、资源与现实反馈; Environment提供任务、工具、资源与现实反馈; Memory保存可复用的信息; Memory保存可复用的信息; Verifier判断结果是否可靠; Verifier判断结果是否可靠; Learning Loop把一次次执行转化为系统能力。
Learning Loop把一次次执行转化为系统能力。前四项,已经逐渐成为工业实践。真正仍未定型的,是最后一项:Learning Loop。
也就是,AI获得经验之后,到底改变什么?四、真正的问题是“经验更新哪里” 在传统模型叙事里,能力提升的路径相对清楚:更多数据,更多算力,更长训练,更强模型。但Agent进入环境后,系统开始产生另一类数据:不是人类提前写好的语料,而是行动产生的经验。
它完成一次任务,失败一次操作,收到一次用户纠正,通过一次评估,都会留下轨迹。问题是,这些轨迹最终应该流向哪里?
一个很有解释力的更新栈是: Experience→Memory→Skill→Context Strategy→Harness→Model Weights Experience→Memory→Skill→Context Strategy→Harness→Model Weights 这条链路把许多看似不同的技术路线放回了同一张图里。
一次经验,最轻量的处理方式,是进入记忆。再进一步,经验可以被提炼为技能:下次遇到类似任务,不必从零开始。继续往上,它可以改变上下文策略:什么信息应被优先召回,什么历史应被压缩,什么证据必须在行动前出现。
再往上,它可能改变Harness:工具如何组合、任务如何分解、失败后如何恢复、哪些步骤必须经过验证。最重的一层,才是更新模型权重。因此,“Harness会不会自我进化”“技能会不会自动优化”“记忆是不是下一代壁垒”,其实都是同一个更根本问题的不同回答: AI获得经验以后,究竟应该修改系统的哪一层?
AI获得经验以后,究竟应该修改系统的哪一层?这也解释了为什么不少所谓“自我进化Agent”,并不一定真的在训练模型。有些系统在更新技能文件,有些在优化提示词,有些在重写工作流,有些在调整工具策略,有些则从历史轨迹中抽取下一轮可执行的规则。
它们的共同点不是“已经实现通用自我进化”,而是开始把经验视为可被处理的生产资料。不过,这条路的门槛很高。微软关于Agent演化的研究综述提出了一个很务实的结论:如果缺少确定、独立的验证器,系统依赖模糊的自我评价,反而可能越优化越差。这很符合工程直觉。让AI自动改进一段代码、一个工作流或一个技能,本质上是在让它修改生产系统。
没有稳定的测试、评估和回滚机制,所谓“学习”很容易退化成随机漂移。因此,自我优化最先适合的领域,往往不是最开放的任务,而是结果可验证的任务。
例如: 能否通过测试; 能否通过测试; 是否完成表单; 是否完成表单; 价格、库存或字段是否正确; 价格、库存或字段是否正确; 代码是否运行; 代码是否运行; 任务是否在约束内完成; 任务是否在约束内完成; 输出是否满足明确标准。输出是否满足明确标准。先有验证,才可能有可靠的改进。
五、经验和环境,可能成为下一条能力曲线 关于下一代AI,最值得重视的变化:“经验”开始被当作独立变量讨论。DeepMind与强化学习路线的长期判断一直很明确:如果系统不能在长期环境中积累、保留和迁移经验,它很难拥有真正持续的能力增长。Demis Hassabis多次强调,持续学习、长期记忆和长周期推理仍是关键缺口。
Agent的重要性,不在于它是一种产品皮肤,而在于它让模型真正进入环境。模型只有进入环境,才能获得后果。有后果,才有反馈。有反馈,才可能形成经验。
字节Seed发布的EdgeBench,是这类讨论中很有代表性的信号。该基准包含134个真实任务、约3.8万小时Agent与环境交互;单个任务通常要求持续操作12小时以上,部分任务延续到72小时。
报告中最值得注意的,是其提出的观察:在特定任务集合中,Agent的表现曲线呈现较稳定的增长趋势;团队还观察到,Agent在部分任务上的学习速度似乎正以大约每三个月翻倍的速度提升。但它提出了一个值得严肃对待的问题: 过去,行业主要讨论参数、算力和token。
未来,能力曲线会不会多出一个横轴: Environment Interaction Time Environment Interaction Time 也就是,系统究竟在真实环境中经历了多少次行动、失败、纠正、验证与再尝试。如果这个变量成立,环境就不再只是模型部署的终点,而会成为能力生产的一部分。
世界不只是供AI使用的工具集合,它也可能是AI获取新数据、形成新策略、积累新技能的训练场。六、OpenAI的RSI,意味着什么?围绕“递归自我改进”的讨论,很容易滑向戏剧化叙事:AI开始自己造AI,然后能力爆炸。
现实版本要克制得多。OpenAI组建RSI团队,重点并不是宣布“我们已经拥有AGI”,而是尝试自动化高质量研究工作:让系统参与研究流程、构建评估、处理反馈、发现缺失能力、生成数据,并帮助改进下一代模型。
这更像一个AI研发飞轮: 研究任务→Agent执行→产生轨迹与反馈→评估→数据与方法改进→更好的模型与系统→更复杂的研究任务 研究任务→Agent执行→产生轨迹与反馈→评估→数据与方法改进→更好的模型与系统→更复杂的研究任务 字节Seed等团队也在让模型参与评估、数据、训练、研究和基础设施工作,并探索小时级、天级的长任务。
这里真正值得观察的指标, 是: AI对AI研发的有效贡献,占整个研发流程的比例是否越过某个临界点。AI对AI研发的有效贡献,占整个研发流程的比例是否越过某个临界点。当AI只能辅助写代码、总结论文时,它是工具。
当AI能持续完成可验证的研究与工程任务,并把结果重新送回训练、评估和系统优化链路时,它才开始成为研发能力的一部分。这距离“递归自我提升”仍然很远,但方向已经很具体。前两天,山姆奥特曼宣称在年底之前可以内部实现。
七、未来三到五年,分歧会落在哪儿?如果把今天看作生成式AI的“中局”,未来不会只剩一条路线。较大的共识是,2026—2027年,持久化Agent Runtime会继续普及。
更多系统会拥有工具、权限、长任务状态、日志、记忆与可恢复能力。2027—2029年,外部学习机制可能成为标准配置:记忆更有效,技能会优化,工作流会重写,上下文策略会调整,Harness会逐渐适应环境,验证器会参与改进。更远一点的分歧,才是模型权重是否需要持续在线更新。
一条路线是:底层模型相对稳定,但外部Runtime、记忆、技能和环境策略持续适应。另一条路线是:模型本身也进入更高频、更连续的学习过程。前者的工程可控性更强,后者的想象空间更大,但安全、遗忘、能力漂移和评估难度也更高。
因此,未来几年最值得追踪的,是几个更朴素的问题: 什么样的经验,真正能转化为能力?什么样的经验,真正能转化为能力?什么样的反馈,足以驱动可靠优化?
什么样的反馈,足以驱动可靠优化?经验应该写入记忆、技能、Harness,还是模型权重?经验应该写入记忆、技能、Harness,还是模型权重?
新能力能否长期保留,并迁移到别的环境?新能力能否长期保留,并迁移到别的环境?谁有能力提供高质量、可验证、可持续的环境?
谁有能力提供高质量、可验证、可持续的环境?当AI获得更多权限时,验证、审计和治理如何同步变厚?当AI获得更多权限时,验证、审计和治理如何同步变厚?
八、Harness是今天的答案,Experience Loop可能才是明天的范式 今天,最成熟的系统答案已经相当清楚: Model+Harness Model+Harness 模型负责理解与推理,Harness让它拥有工具、状态、权限、记忆、日志和工作能力。
但如果把时间拉长,真正决定系统上限的,是Harness能否把行动转化为经验,又能否把经验转化为下一轮更好的行动。所以,生成式AI的中局,不是模型和Agent的二选一。
更像是一场从“预训练模型”走向“持续运行系统”的迁移: Intelligence=Model×Environment×Experience Loop Intelligence=Model×Environment×Experience Loop 模型提供潜力,环境提供后果,经验闭环决定潜力能否持续变成能力。Harness是今天的答案。
Experience Loop,可能才是明天的范式。