内容整理来自 李一舟博士团队 · 仅供学习交流 · 请勿搬运抄袭
A/B/C 对比研究 同系列 Vol.01:人人皆 FDE LIVING DOCUMENT · 每周更新

三个 AI 帮手的一百天

同一台电脑,三种 AI 帮手同时跑了一百多天:Hermes 负责长程工作, OpenClaw 负责稳定收发,Grok Bot 负责实时侦察与问答。 这不是跑分评测,而是一份真实使用记录——谁适合干活、谁适合看门、谁适合打听消息, 以及普通用户怎么把这套组合真正用起来。

145 个历史会话 SIDE A · HERMES AGENT

Hermes

「办公室里的长期助理」

负责要花时间、要动脑子的事:调研、写稿、复盘、定时任务。可以分身成 6 个不同工种的专业助理。

  • 本机版本 v0.20.1(2026-08-19 实测)
  • 默认大脑:GPT-5.6 Sol
  • 145 个历史会话
  • 每周六自动生成研究周报
vs
Telegram 长期在线 SIDE B · OPENCLAW

OpenClaw

「楼下永不打烊的收发室」

负责稳定收发消息:微信、Telegram 等渠道从这里进出。不求花哨,求的是每天在线、不丢消息。

  • 本机版本 2026.7.1-2(已是最新)
  • 10 个 Telegram 机器人全部健康
  • 渠道连接保持在线
  • 日常消息入口,从未掉链子
+
X 平台实时情报 SIDE C · GROK BOT

Grok

「门口最灵的侦察兵」

负责快速问、快速查、快速看风向:热点、舆情、公开讨论、灵感校准。适合问一句话就要答案,不适合替你看家干活。

  • 最佳入口:X / Grok 应用内直接问
  • 强项:实时问答与舆情检索
  • 限制:不适合承担无人值守长任务
  • 本机 API 检索工具暂未完成配置
数据截至 2026-08-25 实测样本 同一台 Mac · 三套角色并行 使用时长 2026-04 起 来源 官方发布记录 + 本机运行日志
01三国杀定位 · What are they

一个管收发,一个管思考,一个管风向

「Harness」直译是马具——把 AI 这匹快马套上缰绳、让它稳定拉车的那套装备。 Hermes 和 OpenClaw 都是 harness,但 Grok Bot 不是同一种东西。 OpenClaw 是收发室,保证消息进得来、出得去;Hermes 是办公室, 保证交代的活儿有人一直跟、跟到底;Grok 是侦察兵, 最快告诉你外面正在发生什么、大家怎么说。

三国杀不是让三个工具互相打架,而是让每个角色守住自己最值钱的位置。
—— 本页写作原则 · 分工大于胜负
0
同一工作流里的 AI 角色
本机实测 · 2026-08-25
0
Hermes 攒下的历史会话
本机数据库实测 · 2026-08-19
0
OpenClaw 在管的 Telegram 机器人
全部在线 · 2026-08-08 实测
0
最适合交给 Grok 的任务粒度
快问快答 · 不做长任务托管
02能力对比矩阵 · Three-way split

八件事,各归各

不看宣传,只看这台电脑上的真实表现。每一行都是日常使用中最常遇到的一件事, 以及三套工具各自的真实答案。

日常这件事
Hermes办公室
OpenClaw收发室
Grok Bot侦察兵
消息从哪进出
微信已移交 Trae Work(8/19),本机不再接消息渠道,专注长任务与专业分身收发交给专用通道
10 个 Telegram 机器人 + 渠道连接,长期在线未掉线收发室的看家本领
不替你接私域消息,主要在 X / Grok 应用里当公开信息入口更像前台的耳目
交代一件要花时间的事
能自己跑几小时的长任务:调研、写稿、复盘,还带 6 个专业分身(研究/内容/分发/复盘/财务/运维)这是它的主场
定位不在此,更擅长可靠地把消息送到不强求
适合"帮我立刻看一圈"这类短任务,不适合丢给它跑半天还自动交付不是后台管家
定时自动干活
有成熟的计划任务:每周六 15:00 自动做调研并写周报,已连跑 5 周本页第 08 章就是它的产出
也有自动化,本机主要用它做消息类任务各管一段
不能把周期性执行当成默认职责,通常需要你主动发问或借助外部调度先问,再答
换「大脑」
可以在多家模型之间切换与兜底:主用 GPT-5.6 Sol,断了自动换 DeepSeek 顶上兜底曾悄悄生效(见第 05 章)
同样支持多模型路由打平
你不是在“配置 Grok”,而是在用 xAI 已经做好的成品省心但不可深控
记性与档案
133 个会话、长期记忆、每个分身独立档案柜记得多,也意味着要管好
会话与配置同样完整,本机更多作为通道使用用法不同
更偏当次问答与平台上下文,不适合把长期公司档案交给它托管记忆不是它的主战场
升级方不方便
一条命令升级,但大版本要先在「试验田」里验证(见第 04 章)快,但要守纪律
更新节奏平稳,本机始终跟着最新稳定版省心
几乎没有本地升级成本,但也意味着你无法决定它什么时候改平台说了算
出问题好不好查
日志、数据库、健康面板都有,但有些「状态显示」会骗人(见第 05 章)查得到,但要会看
状态直观,本机暂未遇到假象目前省心
如果答错了,能追问、能换关键词重试,但你很难像本机系统那样翻日志定位结果导向
最适合的赚钱/落地用法
让 AI 替你持续做研究、写稿、复盘,把人从重复劳动里抽出来时间就是现金流
把客户/团队消息稳定接入一个入口,不漏消息、不失联稳定就是钱
拿来快速验证选题、看舆情、找对标案例、判断一个机会是不是热闹但短命少踩坑就是省钱

注:以上为 2026-08-19 本机实测快照,随版本更新每周复核。结论可能被新版本推翻——推翻记录会保留在本页。

03三国杀推荐位 · Best use cases

普通人最先该抄的,是分工,不是参数

对大多数人来说,先别管模型参数、部署架构和版本号。 真正值钱的是把任务交给对的角色:谁能帮你省时间、谁能帮你少漏消息、谁能帮你更快判断风向。

先交给它 ROLE · GATEKEEPER

OpenClaw:稳定收发,不漏消息

适合把 Telegram / 微信这类高频入口交给它。它的价值不是"更聪明",而是每天都在线、不出戏。

  • 客户消息、群消息、机器人消息
  • 长期在线、低维护、少折腾
  • 适合先做成可靠入口,再谈更复杂自动化
让它去跑 ROLE · CHIEF OF STAFF

Hermes:长程任务和复盘,替你干活

适合要连续跑、反复判断、还要留下结果的事:调研、周复盘、资料整理、内容初稿、自动化巡检。

  • 长程任务、分角色协作、定时周报
  • 适合把"重复劳动"变成可复用流程
  • 本质是把人的注意力换成可沉淀的产出
先问它一圈 ROLE · SCOUT

Grok Bot:实时侦察与快问快答

适合在 X 里快速问:这个热点值不值得追、这个方向有没有争议、同行最近在讨论什么。

  • 热点验证、舆情摸底、公开案例搜索
  • 适合快速判断"要不要投入"
  • 不适合无人值守跑长流程、替你守着公司
04版本演进 · What each upgrade changed

每次升级,到底改变了什么

版本号不重要,重要的是它对日常工作的「有效价值」。 下面是过去六周的真实版本史,每个节点只记一句话:它对每天的使用意味着什么

2026-07-08

Hermes v0.18.2HERMES

本机的起点版本。能用,但微信渠道、定时任务、模型切换各有小毛病。

有效价值:基线参考,无需记住。
2026-07-20

Hermes v0.19.0HERMES

首轮回答提速约 80%;任务中断后重启能接着跑;新增长期密码库接入;新增直接读写 Excel / PDF / Word 的技能。

有效价值:明显变快,值得升。本机 7/25 升级,20 分钟验证通过。
2026-07-30

Hermes v0.19.1HERMES

把 v0.19.0 之后约一千个修复打包:数据库更稳、会话隔离更干净、桌面端不再丢第一条消息。

有效价值:修 bug 的补丁版,跟升不亏。本机 8/2 升级,顺手把默认大脑换成 GPT-5.6 Sol。
2026-08-03

Hermes v0.20.0HERMES

大版本:实时语音对话、回答自带出处引用、桌面端能存文件、跨系统协作协议。但发布后出现三个未修复的问题:旧会话看似消失(数据还在)、长任务可能重复执行、超大会话可能拖垮服务。

有效价值:想要,但先不进现网。8/9 在隔离「试验田」验证:133 个会话迁移零丢失,但安全告警未清零,继续等补丁。
2026-08-04

OpenClaw 2026.7.1-2OPENCLAW

小更新:插件元数据兼容修复。本机当天即为最新,无需任何动作。

有效价值:无感更新,收发室就该这么省心。
2026-08-13

Hermes v0.20.1HERMES

把 v0.20.0 之后约 656 个修复打包成稳定补丁:桌面、网关、工具、安装器全面稳定化;上一版担心的三个问题(旧会话消失、任务重复执行、重启崩溃)本周全部关闭。

有效价值:门禁解除,可以升。本机 8/15 升级,145 个会话零丢失。
2026-08-16 → 08-18

Hermes v0.20.2 → v0.20.4HERMES

三天三个补丁(合计约 596 个 PR):Bot Mode 正式随包、桌面磨砂质感与分页侧栏、定时任务自愈、升级器诚实性;并正式修好了我们 8/15 亲手绕过过的 launchd 服务自拒循环。

有效价值:补丁期,跟升不亏。本机已排期跟进。
2026-08-21

Hermes v0.20.5HERMES

这一版最有用的是"干活的完整性":Bot Mode 群聊线程、折叠摘要、免密钥搜索层、定时任务可带记忆和独立推理强度。对普通用户的意义不是"多了很多功能",而是更像一个能持续接手工作的助理。

有效价值:值得升。如果接下来要把 Telegram 当主入口,这一版明显更贴近目标。
2026-08-25

Grok Bot 角色边界确认GROK

Grok 在本机不是被拿来"跑长任务"的,而是被定位为实时侦察兵:在 X / Grok 应用里做热点判断、舆情摸底、公开讨论快查。它的优势是快,边界是不要把它当后台管家。

有效价值:适合做"先问一圈"的判断题。不适合承担无人值守流程。
2026-08-25 · 今天

现网状态快照NOW

本机 Hermes v0.20.1 连续 10 天零错误;上游已到 v0.20.5。微信移交 Trae Work 后,Hermes 专心当办公室;OpenClaw 保持最新稳定版;Grok 保持"快问快答"前台角色。

当前结论:收发归 OpenClaw,思考归 Hermes,风向归 Grok。
05升级决策复盘 · When to upgrade

三次「升还是不升」

用 AI 工具最频繁的选择题就是升级。三次真实决策,当时的判断、事后的验证、 和能抄走的经验,全在这里。

果断升 决策一 · 2026-08-02

补丁版,果断升

当时:v0.19.1 发布,是把上千个修复打包的补丁版。先整机备份(3.1 GB),再升级,再花 20 分钟跑一遍完整验证。

事后:一次通过,没有回滚。顺手把默认大脑换成 GPT-5.6 Sol,响应质量立即可感。

经验修 bug 为主的补丁版,做好备份就值得马上跟——bug 不会等你。
先隔离 决策二 · 2026-08-03 → 08-09

大版本,先隔离

当时:v0.20.0 带来语音、引用溯源等想要的能力,但发布后出现三个未修复的问题,其中一个会让旧会话"看起来消失"。

做法:不碰正在用的系统,单独复制一份完整环境当「试验田」,在副本里验证:133 个历史会话迁移后一个不少。

经验大版本先在副本里"炸"一遍。验证过了,再决定什么时候轮到现网。
别慌 决策三 · 贯穿五周

别被数字吓着升

诱惑:升级工具一直提示"落后 996 个提交",看起来很紧急。

事实:这个数包含了开发主干上的所有实验性改动,追上去等于当小白鼠。真正该看的只是正式发布的版本号。

经验看正式发布,不看提交数。"落后很多"不等于"应该升级"。
06真实实操档案 · Four real incidents

四次事故,四次长记性

全是这两周真实发生的事:现象、根因、修复、验证、教训,一步不少。 点开任何一个,你都能看到「如果是我遇到,该怎么办」的完整答案。

01

微信显示「已连接」,其实已经断了一周

2026-08-01 → 08-10面板假象
+
现象

控制面板一直显示微信"已连接",但一周里没有任何消息进来。

根因

登录态 8 月 1 日就过期了,系统每 10 分钟报一次错、7 天累计 1,100 次——但面板状态停留在 8 月 2 日,再也没刷新过。

修复

8 月 10 日重新扫码登录,重启服务。

验证

发一条真实消息"你好",33 秒后收到回复;连续观察 12 分钟,报错零新增。

教训

面板上的"已连接"只是一张快照。做一个健康检查:同时看"状态时间"和"最新日志",互相矛盾立刻报警。

关键数字:7 天 · 1,100 次隐藏报错 · 33.7 秒真实闭环回复 · 0 次复发(截至 8/12)
02

问个股价,却弹出「危险操作需要批准」

2026-08-11工具不全
+
现象

在微信里问"海力士美股 ADR 走势",AI 不回答案,反而申请权限去执行一段脚本。

根因

搜索工具没配钥匙(API Key),AI 想查资料只能绕路——自己写脚本去网上抓,而写脚本属于高危动作,必然触发审批。

修复

从密码库里找出早就有的搜索钥匙,配进系统,重启。

验证

再问同样的问题:AI 连续搜索 3 次直接给出走势,0 次脚本、0 次审批。

教训

AI 工具不全时会"想办法",而它的办法往往比你预期的更冒险。把该有的工具配齐,比盯着审批更重要。

关键数字:修复前 1 次高危审批 · 修复后 3 次正常搜索 0 审批
03

回答悄悄变笨了三天,没人发现

2026-08-08 → 08-11静默降级
+
现象

AI 照常回答,开场白也照旧写着"我在用 GPT-5.6",但总觉得回答不如前阵子。

根因

主模型的登录凭证 8 月 8 日被电脑里另一个 AI 工具"抢用"失效——系统设计了兜底,悄悄切换到了备用模型 DeepSeek,全程没有任何报错。

修复

重新登录一次主模型账号。

验证

查真实用量记录:每一次问答实际用哪个模型,白纸黑字——确认已回到 GPT-5.6。

教训

开场白写的模型名不算数(它只是照配置念)。判断"AI 是不是变笨了",唯一可信的是真实用量记录。

关键数字:静默降级 3 天 · 0 报错 · 1 行用量记录戳穿
04

大版本升级前,先在「试验田」里炸一遍

2026-08-09隔离验证
+
现象

v0.20.0 很诱人,但有人反映升级后"旧会话消失了"。

做法

不动正在用的系统,把全部数据(133 个会话、9.6 MB 数据库)复制到隔离环境,在新版本里跑迁移。

结果

好消息:133 个会话、425 条消息迁移后一个不少。坏消息:新版本仍带 12 个未修复的安全告警。

决定

数据安全过关,但安全告警没清零——现网继续用旧版,等补丁。

教训

"别人出问题"不等于"你一定会出","你想要"也不等于"现在该升"。在副本里花半小时验证,比在现网赌一把便宜得多。

关键数字:133 会话零丢失 · 12 个安全告警未清零 · 升级决定:继续等
07经验沉淀 · Rules that survived

六条普通人直接能用的经验

全部从事故里长出来,不涉及任何代码。哪怕你只用一套 AI 工具,也值得抄走。

RULE · 01

别信「已连接」

任何面板上的状态都只是一张旧快照。真要看健不健康,去看它"最近在干什么"——消息有没有流动、错误有没有新增。

来自:事故 01 · 微信假在线一周
RULE · 02

别信「我是某某模型」

AI 开场白报出的模型名只是照配置念台词。感觉回答变笨了,就去查真实的用量记录——那是唯一不会撒谎的地方。

来自:事故 03 · 静默降级三天
RULE · 03

大版本先隔离,补丁版果断升

修 bug 的补丁版,备份完就升;改动大的版本,先在复制的"试验田"里验证数据安全,再决定现网什么时候跟。

来自:第 04 章 · 三次升级决策
RULE · 04

工具配齐,审批自然少

AI 频繁申请"危险权限",多半不是它胆大,而是正经工具没配齐,只能绕路。把搜索、文件这类基础工具配好,审批弹窗会少一大半。

来自:事故 02 · 查股价触发审批
RULE · 05

危险操作前的人工确认,是保险丝

花钱、发布、删东西、改配置之前的"你确定吗",不要嫌烦、不要图快关掉。新版本已出现"任务重复执行"的未修复问题——保险丝在,事故才是小事故。

来自:v0.20.0 已知问题 · 官方 issue 在案
RULE · 06

定期检查,比出事再修便宜

每周花二十分钟看一次:版本有没有更新、渠道健不健康、上次的问题有没有复发。这个站本身,就是每周六自动巡检的产出。

来自:五周周报机制 · 第 08 章
08分工架构 · Who does what

三个角色,一家小公司

这台电脑上实际跑的是「四个 AI 员工」的分工制。理解了这个结构, 你就理解了为什么不是"选一个最好的工具",而是"让每个工具待在对的位置"。

「收发室」 ROLE · GATEKEEPER

OpenClaw

所有消息从这里进出。评价它的唯一标准:在线、不丢、别出事。

  • 10 个 Telegram 机器人在线
  • 消息渠道日常入口
  • 版本永远跟最新稳定版
  • 原则:稳定的地方不乱动
「办公室 + 试验田」 ROLE · CHIEF OF STAFF

Hermes

长任务、周报告、新功能试验都在这里。可以折腾,因为它不直接守着大门。

  • 6 个专业分身各司其职
  • 每周六自动产出研究周报
  • 新版本先在它的隔离环境试
  • 原则:试验的地方做隔离
「施工队」 ROLE · BUILDER

Codex

写代码、建网站、修系统这类工程活,由它在受控的工作区里完成。

  • 本页网站就是它的产出
  • 改动有记录、可验证、可回滚
  • 高风险操作必须人工确认
  • 原则:施工的地方留证据
「侦察兵」 ROLE · SCOUT

Grok Bot

快问快答、舆情侦察、公开讨论摸底。它是最适合做"先问一圈"的那一个,但不适合替你看家长期任务。

  • X / Grok 应用内直接使用
  • 热点、风向、公开案例快速验证
  • 不承担本机自动化主链路
  • 原则:先问它,再决定要不要深入
为什么不合并成一个? 也想过。但"稳定"和"爱折腾"天生矛盾:让收发室去试新功能, 大门就可能看丢;让办公室墨守成规,新能力就永远进不来;把侦察兵当总管家,又容易把"热闹"误当"答案"。 分开,是每个角色都能做好本职的前提。 本结论为当前判断 · 若未来版本改变格局,会在此标注推翻记录
09每周研究索引 · The weekly log

这个站自己长出来的过程

每周六 15:00,Hermes 自动做一轮调研写一份周报;每周一,本页根据周报更新。 下面的追踪表说明这套机制怎么运转:每周的优先事项(P0 必须马上办 / P1 安排窗口办 / P2 继续观察), 以及它们后来的命运。

本周焦点
P0 · 必须办
P1 · 安排办
后来怎样了
07-11
建立基线:版本、渠道、模型全面盘点
不追开发主干,等稳定版
执行 等了 9 天,v0.19.0 发布
07-18
v0.19.0 即将发布,准备升级窗口
升级前先做全量备份
执行 备份习惯从此固定
07-25
v0.19.0 发布,授权升级并完成验证
升级 v0.19.0
完成 20 分钟验证通过
08-01
v0.19.1 发布;企业微信渠道修复
升 v0.19.1 + 换默认大脑
完成 8/2 升级并切 GPT-5.6 Sol
08-08
发现微信"假在线"已一周;v0.20.0 发布
恢复微信
v0.20.0 先进隔离试验田
完成 微信 8/10 恢复 · 试验田 8/9 建成
08-15
微信 4 天后再次失效;v0.20.1 发布
微信重扫
升级 v0.20.1
完成 8/15 升 v0.20.1(145 会话零丢失)· 微信移交 Trae Work 后停用
08-19
上游三天三补丁到 v0.20.4;本机三天零错误
升 v0.20.4(先还原本地补丁)
待执行 升级窗口未开

完整周报存档:本机 ~/Desktop/Hermes agent/每周研究/ · 共 8 期,每周六自动新增

这张表最有价值的不是"做完了什么",而是每一条判断都有后来——对的留下,错的标注。
—— 持续更新的意义 · 判断可追溯