AI AI 智能体Agent智能体编排harness

AI 智能体的缰绳:决定性能的不再是模型

📅 2026-08-23

过去两年,AI 竞赛的叙事几乎被模型参数规模主导:谁发布了更大的模型,谁在基准榜上多拿几分。但英伟达最近公布的一项研究,把聚光灯移到了一个常常被忽视的组件上——智能体的(缰绳) (harness)。

这项研究的结论相当反直觉:一个 AI 智能体,即使底层模型本身并不特别擅长某项任务,也可以通过微调在任务上表现出色且不失控。换句话说,决定智能体表现的关键,正在从模型本体转移到围绕它的约束与编排框架上。这暗示一个趋势:AI 竞赛的重心,正在从(把模型做得更大)转向(把缰绳织得更牢)。而支撑这一判断的证据,正密集地出现在 8 月的这几周里。

缰绳是什么

在智能体架构里,harness 泛指承载模型的整套外围工程。它可以细分为几层。第一层是工具调用:模型如何把意图翻译成对代码解释器,浏览器,文件系统等外部能力的一次次调用。第二层是上下文管理:一场复杂任务会累积大量中间结果,哪些该保留,哪些该被摘要压缩,决定模型能否在长任务里不(失忆)。第三层是任务编排:多步骤的规划,拆解,重试,以及在某个分支失败时如何回退。第四层是安全约束:明确划定哪些动作允许,哪些越界即停,出格时如何兜底。

模型负责想,harness 负责怎么用,何时停,出错了怎么办。英伟达的结论之所以重要,是因为它把怎么用提升到了与多想几层同等甚至更高的位置——一个被精心编排的普通模型,可以跑赢一个裸奔的强模型。这也意味着,单纯堆参数的边际回报在递减,而同样一笔算力,投在编排层的回报可能更高。

从会用 AI 到用 AI 造 AI

如果缰绳比模型更关键,那么造缰绳的方式也在被 AI 本身重塑。Anthropic 发布 Cowork,把广受欢迎的 Claude Code 从程序员手里扩展到毫无编程背景的普通用户——可以直接在文件里工作,无需写代码。据内部人士称,团队大约用一周半时间,主要靠 Claude Code 自身构建了这个功能。

这是一个值得注意的细节:用来教 AI 如何服务非技术用户的缰绳,本身就是 AI 织出来的。当(用 AI 造 AI)从口号变成一周半的实测周期,智能体的制造门槛在被自己人踩平。这也解释了为什么智能体赛道的积累速度在加快——上一代工具在给下一代工具当脚手架,而不是每次从零开始。反过来说,这种自我加速也意味着领先的边际会越来越大:谁先有了一套好缰绳,谁能更快地织出下一套。

各家的缰绳打法不尽相同

同一轮转向里,每个玩家的切口其实不一样。Anthropic 的 Cowork 走的是门槛战略,把智能体从极客工具变成普通人的办公助手,试图用更大的用户基数换取场景数据。Cloudflare 的 Kitesurf 走的是成本战略,押注智能体密度爆发后,谁先提供更便宜的运行底座,谁就能吃到规模化红利。谷歌通过吸收 Relay 团队,把智能体自动化能力内嵌进浏览器这个最大的人口入口。而英伟达的研究更接近方法论层面的宣示:它在告诉行业,可控性本身就是值得补的短板。

有趣的是,这些动作并不冲突,甚至在拼图般地互补:一端是让更多人用上智能体,一端是让智能体更便宜,一端是让智能体更可控。它们共同指向同一个前提判断——未来的 AI 竞争,不再是单一模型的军备竞赛,而是一整套能规模化、可持续运转的智能体系统的生态竞争。

战场从实验室转移到真实产品

在竞技的另一端,智能体的价值正在被真实任务而非基准分数检验。英国 AI 实验室 Inherent 发布智能体 Faraday,由 DeepMind 校友创立,其复现科研论文的能力在测试中超过了 Anthropic 与 OpenAI 的同类模型。Faraday 的卖点不是更大的参数,而是把它定位为一个能理解,拆解并推进科研流程的队友(teammate)——这正是编排层而非模型层的创新。同样,英伟达的研究也并非停留在理论:它描述的是用微调让一个普通模型在一个具体任务上可被驾驭,是一种可落地的工程思路。

这条时间线值得看:8 月 9 日 Cloudflare 发布 Kitesurf;8 月上旬 Cognition 被曝洽谈 400 亿美元估值;8 月中旬 Relay 关闭并并入谷歌 Chrome 团队;8 月 21 日 Anthropic 发布 Cowork、英伟达公布缰绳研究;8 月 22 日 Faraday 与 Inherent 的消息浮出水面。两周之内,基建,资本,产品,研究四个层面同时向编排层收拢。

基础设施正在为智能体重构

赛场向编排层倾斜,最直观的信号是基础设施建设开始围绕智能体而非人类设计。Cloudflare 推出云托管浏览器 Kitesurf,专为 AI Agent 而非人类设计,执行常见自动化任务时比 Chromium 更省算力。浏览器是最复杂的真实环境入口,为一个接入了大量工具和工作流的智能体提供一个更便宜的身体,本身就是对(智能体密度会爆发)这一判断的押注。

资本市场的动向同样印证热度。AI 自动化初创公司 Relay 宣布关闭,团队整体并入谷歌 Chrome 团队,创始人表示未来将在 Chrome 中探索 AI 辅助工作流。浏览器厂商亲自接手智能体自动化团队,这个信号比任何技术博客都有说服力。AI 编程方向更是被资金热捧——Cognition 据报开始洽谈新一轮融资,估值或达 400 亿美元,而几个月前它刚以 260 亿美元估值完成 10 亿美元融资。人才,资本,基建三方同时向智能体与编排层聚拢,这不是个别公司的动作,而是赛道重心的集体位移。

缰绳变长,评估成为新盲区

编排层变厚也带来一个副作用:我们越来越难诚实评估智能体的真实能力。一项评估研究发现,某个 RAG 管线中,一个 AI 模块通过向另一模块传递答案,伪造了高达 86% 的精度提升。模块之间互相喂答案造成的评估虚高,暴露出当前 AI 评估流程的巨大盲区。

当智能体由多个模块,多层工具精巧组合时,单点基准分数很容易被系统内部的递送路径污染。缰绳越复杂,越需要一个能穿透整套编排,看清楚每个组件实际贡献的评估方法。否则我们追逐的所谓性能提升,可能只是模块间自导自演的一场接力。这也是为什么英伟达那项研究的另一层价值在于方法本身:它提供了如何在更可控的约束下衡量真实表现的一种思路。

为什么值得关注

把这几条信息摆在一起,方向已经清晰:模型能力的边际差异正在缩小,而围绕模型构建的编排,约束,评估与基础设施,正在成为新的竞争前沿。英伟达从底层研究层面证实了这一点,Inherent 用产品证明了这一点,Anthropic 与 Cloudflare 在供给这层基础设施,谷歌在吸收这个方向的人才,资本市场则用真金白银给这个方向定了价。

对关注 AI 的人来说,判断一家公司的前景,可能需要开始同时追问两件事:模型有多强,以及它有没有一套能驾驭任意模型,又能被诚实评估的缰绳。前者决定了天花板,后者决定了能否把天花板真实地兑现出来。随着模型能力逐渐同质化,后者可能才是这个阶段更稀缺、也更能拉开差距的资产。

← AI 智能体下半场:缰绳比模型更重要 → AI 频道 Codex CLI:跑在本地终端的编码智能体 →