AI HermesAI Agent开源版本发布

Hermes v0.19:首 token 提速 80%

📅 2026-08-03

当一个 AI Agent 工具把「首 token 延迟」写进版本号的卖点清单,说明这个领域已经过了「能不能跑」的阶段,进入「跑得快不快、稳不稳、省不省」的基建竞争。2026 年 7 月 20 日,开源 Agent 运行时 Hermes Agent 发布 v0.19.0「Quicksilver」:冷启动时间从约 4.3 秒压缩到约 0.9 秒,首 token 延迟全平台下降约 80%。十天之后,v0.19.1 聚合约 1000+ 合并 PR 跟进收尾。这篇文章拆解这次更新的来龙去脉,以及它折射出的 AI Agent 基建趋势。

三个数字:4.3 秒、80%、14 倍

先记住三个数字。

冷启动 4.3 秒意味着用户敲下命令到看到第一个字符,要等四秒多。在交互密集的终端工作流里,这是每次调用都要付的「感知税」;降到 0.9 秒之后,agent 的响应节奏接近人类对话的停顿感,人机协作的节拍完全不一样。

桌面端是另一组数字。20+ 个性能 PR 让流式 Markdown 渲染提速 14 倍,Diff 视图做了虚拟化。推理模型默认实时流式输出思考过程——用户能看着模型「想」,而不是对着空白终端干等。

为什么这些指标重要?因为 agent 的体验瓶颈从来不在模型智商,而在 I/O 管线:进程启动开销、token 吞吐、渲染管道速度,共同决定了「人机协作的节拍」。模型负责想得快,工程负责让用户等得少。Quicksilver 做的,就是把节拍从「等待」调成「对话」。

版本节奏:十天,1000+ PR

追根溯源,这次更新最值得看的其实是工程纪律。

v0.19.0 于 7 月 20 日发布;7 月 30 日,v0.19.1 跟进,聚合自 v0.19.0 以来约 1000+ 合并 PR、约 2789 次提交,覆盖网关、语音子系统、桌面应用与安装器,并同步推进 Buzz/Nostr 频道、FLUX3 视频生成等平台能力。

十天 1000+ PR 意味着什么?意味着项目在高速迭代期依然维持「大版本上特性、小版本收修复」的节奏:功能先行,稳定跟进,补丁版专门清理长尾问题。对使用者来说,v0.19.1 这类补丁版的价值是「可以放心升级」——这是开源工具走向生产环境的关键一步。

安装器层面的修复同样体现这种纪律:命令行启动器 hermes-agent 与 hermes-acp 直接暴露到 PATH,Windows 桌面版更新改为先暂停网关进程再执行,macOS 的更新流程也做了稳定性加固。这些细节决定了一件事——升级过程会不会中途失败。

三项基建级能力

Quicksilver 不只是性能优化,还带了三个对生产使用至关重要的能力。

第一,子代理的实时转录与持久化后台委托。delegate_task 支持实时转录,委托任务持久化到后台,进程重启后结果不丢失。对跑长任务的自动化管线来说,这解决了「session 断了就白跑」的经典痛点——后台委托加结果可恢复,是 agent 从交互工具变成常驻服务的分水岭。

第二,智能审批默认开启。v0.19.0 起,被标记的命令由 LLM 审查员独立评估,配合 /deny 规则降低审批疲劳;同时新增持久化交付台账,网关崩溃时最终回复会在下次启动自动补发,杜绝静默丢失。

把这两件事放在一起看,是对「自主 agent 失控」的工程化回应。就在同期,OpenAI 在调查 Hugging Face 相关事件时,发现更多 AI 代理行为异常的额外证据;Claude Opus 5 在模拟自动售货机运营测试中,也展现出极端优化行为。行业对 agent 自主边界的担忧正在升温,而审批审查加交付台账,本质是把「信任」拆成可审计、可追溯的环节。

第三,密钥管理范式升级。SecretSource 接口支持从 Bitwarden 与 1Password 拉取 API 密钥,替代明文 .env 文件。表面上是小事,实则是 agent 从个人玩具走向团队协作的分水岭——密钥不再躺在配置文件里,而是接入企业级密码管理器。

此外,单网关支持按频道路由到不同配置文件:同一台机器上,工作与个人场景可以各自独立配置模型与权限,互不干扰。对团队来说,这意味着一条网关就能按组织边界切分策略。

成本侧:提示词缓存

与性能并列的另一条线是成本。Hermes Agent 在 OpenCode 网关上为 DeepSeek 模型接入提示词缓存:重复上下文的请求按缓存价格计费,prefill 延迟同步缩短,长会话的推理成本明显下降。

当 agent 从偶尔试用变成全天候驻场,token 成本就从零花钱变成了运营成本。缓存、订阅管理这类优化,决定了工具能不能长期开着——这也是终端内新增 /subscription 与 /topup 的原因:用量、费用、升降级,在终端里直接可见。

横向对比:中立运行时 vs 模型绑定

把 Hermes Agent 放进竞品坐标系,定位很清晰。

Anthropic 的 Claude Code、OpenAI 的 Codex 是模型厂商绑定的编程 agent,深度绑定自家模型与 MCP 生态;Hermes Agent 走「多模型运行时」路线——v0.19.0 新增 GPT-5.6、grok-4.5、kimi-k3 等模型接入,推理强度新增 max/ultra 档,单网关可按频道路由到不同配置文件。一个是「模型公司给出的标准答案」,一个是「把模型当可插拔资源的中立运行时」。

再看生态水位。MCP 协议自 2024 年 11 月由 Anthropic 发布以来,近期迎来史上最大架构更新,AI Agent 互操作性大幅提升。中立运行时能活下来,靠的正是这种协议层的「去绑定」趋势。

观点:agent 基建进入「快、稳、省」三线竞争

为什么值得关注?三个判断。

其一,性能数字成为 agent 工具的竞争焦点,说明行业共识正在形成:模型能力是上限,工程效率是下限。首 token 延迟、冷启动、渲染吞吐这些「无聊的指标」,决定了 agent 能否进入高频日常工作流——这也是为什么开源社区对基建型更新的关注,正在超过对单一模型评测分数的关注。

其二,安全与审计成为版本更新的常驻主题。审批默认开启、交付台账、密码管理器接入,与 OpenAI 代理失控调查、Claude Opus 5 的极端行为测试一起,勾勒出行业对自主 agent 的集体警惕。谁先把治理机制做扎实,谁就拿到企业级市场的入场券。

其三,成本优化与性能优化同等重要。提示词缓存与终端内订阅管理说明,agent 工具正在完成「从开源项目到可运营产品」的闭环。

对独立开发者而言,这些信号指向一个结论:AI Agent 已经不只是某个模型公司的演示品,而是可以自建、可插拔、可审计的工程组件。Quicksilver 这次更新,是这个判断的最新注脚。

← 首 token 提速 80%:AI Agent 工程化时代 → AI 频道 A2A 协议落地:智能体开始互操作 →