同一台电脑,三种 AI 帮手同时跑了一百多天:Hermes 负责长程工作, OpenClaw 负责稳定收发,Grok Bot 负责实时侦察与问答。 这不是跑分评测,而是一份真实使用记录——谁适合干活、谁适合看门、谁适合打听消息, 以及普通用户怎么把这套组合真正用起来。
负责要花时间、要动脑子的事:调研、写稿、复盘、定时任务。可以分身成 6 个不同工种的专业助理。
负责稳定收发消息:微信、Telegram 等渠道从这里进出。不求花哨,求的是每天在线、不丢消息。
负责快速问、快速查、快速看风向:热点、舆情、公开讨论、灵感校准。适合问一句话就要答案,不适合替你看家干活。
「Harness」直译是马具——把 AI 这匹快马套上缰绳、让它稳定拉车的那套装备。 Hermes 和 OpenClaw 都是 harness,但 Grok Bot 不是同一种东西。 OpenClaw 是收发室,保证消息进得来、出得去;Hermes 是办公室, 保证交代的活儿有人一直跟、跟到底;Grok 是侦察兵, 最快告诉你外面正在发生什么、大家怎么说。
三国杀不是让三个工具互相打架,而是让每个角色守住自己最值钱的位置。—— 本页写作原则 · 分工大于胜负
不看宣传,只看这台电脑上的真实表现。每一行都是日常使用中最常遇到的一件事, 以及三套工具各自的真实答案。
注:以上为 2026-08-19 本机实测快照,随版本更新每周复核。结论可能被新版本推翻——推翻记录会保留在本页。
对大多数人来说,先别管模型参数、部署架构和版本号。 真正值钱的是把任务交给对的角色:谁能帮你省时间、谁能帮你少漏消息、谁能帮你更快判断风向。
适合把 Telegram / 微信这类高频入口交给它。它的价值不是"更聪明",而是每天都在线、不出戏。
适合要连续跑、反复判断、还要留下结果的事:调研、周复盘、资料整理、内容初稿、自动化巡检。
适合在 X 里快速问:这个热点值不值得追、这个方向有没有争议、同行最近在讨论什么。
版本号不重要,重要的是它对日常工作的「有效价值」。 下面是过去六周的真实版本史,每个节点只记一句话:它对每天的使用意味着什么。
本机的起点版本。能用,但微信渠道、定时任务、模型切换各有小毛病。
有效价值:基线参考,无需记住。首轮回答提速约 80%;任务中断后重启能接着跑;新增长期密码库接入;新增直接读写 Excel / PDF / Word 的技能。
有效价值:明显变快,值得升。本机 7/25 升级,20 分钟验证通过。把 v0.19.0 之后约一千个修复打包:数据库更稳、会话隔离更干净、桌面端不再丢第一条消息。
有效价值:修 bug 的补丁版,跟升不亏。本机 8/2 升级,顺手把默认大脑换成 GPT-5.6 Sol。大版本:实时语音对话、回答自带出处引用、桌面端能存文件、跨系统协作协议。但发布后出现三个未修复的问题:旧会话看似消失(数据还在)、长任务可能重复执行、超大会话可能拖垮服务。
有效价值:想要,但先不进现网。8/9 在隔离「试验田」验证:133 个会话迁移零丢失,但安全告警未清零,继续等补丁。小更新:插件元数据兼容修复。本机当天即为最新,无需任何动作。
有效价值:无感更新,收发室就该这么省心。把 v0.20.0 之后约 656 个修复打包成稳定补丁:桌面、网关、工具、安装器全面稳定化;上一版担心的三个问题(旧会话消失、任务重复执行、重启崩溃)本周全部关闭。
有效价值:门禁解除,可以升。本机 8/15 升级,145 个会话零丢失。三天三个补丁(合计约 596 个 PR):Bot Mode 正式随包、桌面磨砂质感与分页侧栏、定时任务自愈、升级器诚实性;并正式修好了我们 8/15 亲手绕过过的 launchd 服务自拒循环。
有效价值:补丁期,跟升不亏。本机已排期跟进。这一版最有用的是"干活的完整性":Bot Mode 群聊线程、折叠摘要、免密钥搜索层、定时任务可带记忆和独立推理强度。对普通用户的意义不是"多了很多功能",而是更像一个能持续接手工作的助理。
有效价值:值得升。如果接下来要把 Telegram 当主入口,这一版明显更贴近目标。Grok 在本机不是被拿来"跑长任务"的,而是被定位为实时侦察兵:在 X / Grok 应用里做热点判断、舆情摸底、公开讨论快查。它的优势是快,边界是不要把它当后台管家。
有效价值:适合做"先问一圈"的判断题。不适合承担无人值守流程。本机 Hermes v0.20.1 连续 10 天零错误;上游已到 v0.20.5。微信移交 Trae Work 后,Hermes 专心当办公室;OpenClaw 保持最新稳定版;Grok 保持"快问快答"前台角色。
当前结论:收发归 OpenClaw,思考归 Hermes,风向归 Grok。用 AI 工具最频繁的选择题就是升级。三次真实决策,当时的判断、事后的验证、 和能抄走的经验,全在这里。
当时:v0.19.1 发布,是把上千个修复打包的补丁版。先整机备份(3.1 GB),再升级,再花 20 分钟跑一遍完整验证。
事后:一次通过,没有回滚。顺手把默认大脑换成 GPT-5.6 Sol,响应质量立即可感。
当时:v0.20.0 带来语音、引用溯源等想要的能力,但发布后出现三个未修复的问题,其中一个会让旧会话"看起来消失"。
做法:不碰正在用的系统,单独复制一份完整环境当「试验田」,在副本里验证:133 个历史会话迁移后一个不少。
诱惑:升级工具一直提示"落后 996 个提交",看起来很紧急。
事实:这个数包含了开发主干上的所有实验性改动,追上去等于当小白鼠。真正该看的只是正式发布的版本号。
全是这两周真实发生的事:现象、根因、修复、验证、教训,一步不少。 点开任何一个,你都能看到「如果是我遇到,该怎么办」的完整答案。
控制面板一直显示微信"已连接",但一周里没有任何消息进来。
登录态 8 月 1 日就过期了,系统每 10 分钟报一次错、7 天累计 1,100 次——但面板状态停留在 8 月 2 日,再也没刷新过。
8 月 10 日重新扫码登录,重启服务。
发一条真实消息"你好",33 秒后收到回复;连续观察 12 分钟,报错零新增。
面板上的"已连接"只是一张快照。做一个健康检查:同时看"状态时间"和"最新日志",互相矛盾立刻报警。
在微信里问"海力士美股 ADR 走势",AI 不回答案,反而申请权限去执行一段脚本。
搜索工具没配钥匙(API Key),AI 想查资料只能绕路——自己写脚本去网上抓,而写脚本属于高危动作,必然触发审批。
从密码库里找出早就有的搜索钥匙,配进系统,重启。
再问同样的问题:AI 连续搜索 3 次直接给出走势,0 次脚本、0 次审批。
AI 工具不全时会"想办法",而它的办法往往比你预期的更冒险。把该有的工具配齐,比盯着审批更重要。
AI 照常回答,开场白也照旧写着"我在用 GPT-5.6",但总觉得回答不如前阵子。
主模型的登录凭证 8 月 8 日被电脑里另一个 AI 工具"抢用"失效——系统设计了兜底,悄悄切换到了备用模型 DeepSeek,全程没有任何报错。
重新登录一次主模型账号。
查真实用量记录:每一次问答实际用哪个模型,白纸黑字——确认已回到 GPT-5.6。
开场白写的模型名不算数(它只是照配置念)。判断"AI 是不是变笨了",唯一可信的是真实用量记录。
v0.20.0 很诱人,但有人反映升级后"旧会话消失了"。
不动正在用的系统,把全部数据(133 个会话、9.6 MB 数据库)复制到隔离环境,在新版本里跑迁移。
好消息:133 个会话、425 条消息迁移后一个不少。坏消息:新版本仍带 12 个未修复的安全告警。
数据安全过关,但安全告警没清零——现网继续用旧版,等补丁。
"别人出问题"不等于"你一定会出","你想要"也不等于"现在该升"。在副本里花半小时验证,比在现网赌一把便宜得多。
全部从事故里长出来,不涉及任何代码。哪怕你只用一套 AI 工具,也值得抄走。
任何面板上的状态都只是一张旧快照。真要看健不健康,去看它"最近在干什么"——消息有没有流动、错误有没有新增。
AI 开场白报出的模型名只是照配置念台词。感觉回答变笨了,就去查真实的用量记录——那是唯一不会撒谎的地方。
修 bug 的补丁版,备份完就升;改动大的版本,先在复制的"试验田"里验证数据安全,再决定现网什么时候跟。
AI 频繁申请"危险权限",多半不是它胆大,而是正经工具没配齐,只能绕路。把搜索、文件这类基础工具配好,审批弹窗会少一大半。
花钱、发布、删东西、改配置之前的"你确定吗",不要嫌烦、不要图快关掉。新版本已出现"任务重复执行"的未修复问题——保险丝在,事故才是小事故。
每周花二十分钟看一次:版本有没有更新、渠道健不健康、上次的问题有没有复发。这个站本身,就是每周六自动巡检的产出。
这台电脑上实际跑的是「四个 AI 员工」的分工制。理解了这个结构, 你就理解了为什么不是"选一个最好的工具",而是"让每个工具待在对的位置"。
所有消息从这里进出。评价它的唯一标准:在线、不丢、别出事。
长任务、周报告、新功能试验都在这里。可以折腾,因为它不直接守着大门。
写代码、建网站、修系统这类工程活,由它在受控的工作区里完成。
快问快答、舆情侦察、公开讨论摸底。它是最适合做"先问一圈"的那一个,但不适合替你看家长期任务。
每周六 15:00,Hermes 自动做一轮调研写一份周报;每周一,本页根据周报更新。 下面的追踪表说明这套机制怎么运转:每周的优先事项(P0 必须马上办 / P1 安排窗口办 / P2 继续观察), 以及它们后来的命运。
完整周报存档:本机 ~/Desktop/Hermes agent/每周研究/ · 共 8 期,每周六自动新增
这张表最有价值的不是"做完了什么",而是每一条判断都有后来——对的留下,错的标注。—— 持续更新的意义 · 判断可追溯