# 普通用户未必需要一个通用 Agent

上一篇我写到，AI最容易制造的错觉，是把“做出东西”误认为“解决问题”。网页、PPT和数据报告，只要长得足够像样，就会给人很强的即时满足感。尤其是在社交网络上，一个类demo形态的产物只要足够漂亮，就很容易被理解成“普通人也获得了一个小团队的能力”。这是我们正在经历的又一场光怪陆离的幻觉。

如果把这个思考继续往前推进，就会进入最近炙手可热的“通用Agent叙事”。显然，Agent比Chatbot更让人兴奋，因为它看起来不再只是聊天，而是可以替人行动。它能接入工具，读写文件，还能安排任务，甚至假装自己有一点类似人类的长期记忆。这个大饼画得太有诱惑力了：每个人都拥有一个数字员工，随时可以听候命令，自动替你把那些烦人的工作都处理掉。这无异于数字飞升，永享天福。

作为泼凉水专业户，我对这个神话充满质疑。Agent当然是很有价值，也会成为大量产品的核心组成部分，在很多专业场景里产生真实作用。但我的担忧在于：面向广大普通用户的独立通用Agent，很可能把少数硬核用户的爽感误读成了大众市场的需求。

普通人当然需要AI（就算只是为了情绪价值），这个结论在现在已经无可置喙。问题在于，他们需要的是一个能随时打开、不管是什么问题都会耐心解答的小可爱，还是一个把配置、授权、验证和token账单都交给自己的重型工程系统？这两个东西看起来都叫AI，但对应的是完全不同的用户负担。

## Chatbot已经覆盖了大量现实需求

对大多数普通用户来说，Chatbot现在仍然是最好的AI入口。它在AI FOMO的情绪下显得不够性感，也不太像一个“未来产品”，但它解决的问题非常朴实。一段材料读不下去，一封邮件不知道怎么开头，一个想法在心中兜兜转转需要有人帮忙展开，Chatbot都能很快“稳稳地接住”。

这个入口的关键价值是低负担。用户打开就能问，它不要求用户理解运行环境和用户管理权限，也不教导用户学习配置API key和查看token账单。它的失败也相对简单粗暴：一次回答不好，大不了删掉重来。这看起来不起眼但至关重要。普通人使用AI的很多场景，本来就无法依赖一个完整的自动化系统。他只是希望在当前这一步被推一下，在自然语言的交互中获得启发。上一篇提到过：很多AI使用的价值，本来就在于让人获得知识、快乐和行动意愿，不必都包装成生产力革命。

通用Agent的问题，是它很容易把这种低负担入口改造成高负担系统。产品演示里，它会显得更厉害，因为它往前多走了几步，只要你授权更多工具给它，工具似乎就被AI调度得风生水起。但隐藏在背后的问题在于，用户也要因此而跟着多承担几层责任。它读取的数据的口径是否合理，调用工具出错以后如何发现，长期记忆如何取舍，这些问题很快会从产品背后走到用户面前。

## 演示成功在掩盖长期成本

我能理解很多人第一次看到通用Agent时的兴奋。一句话就能生成一个网站，睡觉的时候电脑自动帮你发邮件找供应商砍价，甚至还可以让硅谷的大佬们在电脑屏幕上开会只为了讨论某个岗位需要什么MBTI特质的人才。用户刚走神回来，AI已经替他做出了一堆东西。这个瞬间非常容易让人相信AGI很快就要实现了。

但我们已经在第一篇里说过，类demo形态最擅长制造错觉。对通用Agent来说，这个问题还会更严重。因为Agent展示的不只是产物，还有“它替我行动了”的戏剧性。它会让人觉得自己终于拥有了一个数字管家。可是真的能用起来远远不是演示。一个可复制的工作的数据和目标是清晰可靠的，而且错误也要能被发现和恢复。

一次演示只需要在人工高度干预的情况下跑通一次，而长期使用则要求它在相似但不断变化的条件下反复跑通。今天的数据格式变了，明天账号权限变了，后天模型理解错了一个细节，系统都要能被发现和修复。一个Agent如果只是生成一份报告，也许问题还不大，如果它开始发邮件、改文件，甚至碰到真实业务系统，风险马上就变成另一回事。

这也是我最不认同“人人都应该拥有一个通用Agent”的地方。它把必然存在的工程化责任包装成了另一个富有亲和力的个人效率工具。普通人只是想整理账单，跟进邮件，规划旅行，或者让AI帮自己做一点信息处理，为什么要承担系统管理员的工作？为什么要学会照看权限、日志、prompt和长期记忆？如果一个产品要用户先接受这套注意力成本，才能稳定获得价值，它就已经离大众入口很远了。

当然，确实会有一部分普通用户在这个过程中变强。他们会被AI焦虑推动，开始学习自动化，学习脚本，学习怎么把一个流程长期跑起来。但这种人已经不再是典型普通用户。他正在变成类程序员，或者至少变成某种AI workflow owner。把这类人的成功算成“大众通用Agent成功”，就像把少数会折腾NAS的人算成家庭服务器的大众化成功，结论会有所偏颇。

## Coding Agent的成功有特殊前提

我知道肯定会有很多人拿Claude Code和Codex来证明通用Agent将会成功。我觉得这个类比仍然存在偷换概念的嫌疑。AI coding确实是目前最成功的Agent场景之一，但它成功的原因，恰恰说明普通大众市场会很艰难。

代码世界天然适合Agent。一个修改能不能运行，第一时间就有工程化的反馈。测试、类型检查和CI会继续缩小错误空间。Git diff告诉你它改了什么，commit记录告诉你它怎么改的，review机制还能把人重新拉回关键判断。软件工程原本就有仓库和依赖管理，也有日志、回滚和验收。Agent进入的是一个高度结构化的世界。

程序员也天然适合这种工具。会写代码只是表层，更关键的是他们长期训练了另一套能力：把模糊需求拆成任务，把任务放进工程环境，把结果交给测试和review，把失败现场保留下来，再从日志和diff里判断下一步怎么做。Agent在这里没有替代工程化能力，它反而极度依赖工程化能力。

这解释了为什么Claude Code能迅速进入程序员工作流，也解释了为什么Codex的产品定义相对克制。Codex没有被包装成普通人的万能管家，它看起来像Agent，底层借用的是软件工程几十年积累下来的验证系统。

把这个经验搬到普通用户场景，就会立马出现流程上的断裂。股票分析看起来很专业，未必承担了风险；PPT做得漂亮，未必推动了决策；网页能打开，未必有人长期使用；定时新闻聚合每天都能生成，未必比成熟的新闻App推送更有可读性。离开代码世界以后，目标变得含混，验证变得主观，回滚机制也往往不存在。Agent最需要的支点开始松动。

## 程序员不会消失，反而会变得更重要

这里稍微花点时间展开一下，如何看待程序员这个角色。如果程序员只是“写代码的人”，那AI会写代码以后，程序员的意义就会被严重削弱。可现实里，程序员真正承担的工作从来不只是把字敲进编辑器。

如果普通用户都会写代码，很多应用本来早就应该消失了。每个人可以写自己的记账软件，写自己的CRM，写自己的数据分析工具，甚至写一个完全贴合自己习惯的日程系统。在这些AI浪潮之前，历史上类似的想象已经出现过很多次了：建站工具、办公自动化、低代码和数据分析平台，都曾经承诺让更多普通人直接创造工具。但结果大家都看到了，全民开发并没有成为主流。

这个结果一点也不奇怪。普通用户最终想要的，是“不用理解系统也能解决问题”。他们使用浏览器、App、办公软件和云服务，原因很简单：有人把复杂性压进了产品边界里。新技术越多越强，普通用户越需要无负担地使用它。

AI没有理由不走这条路。模型越强，能创造的应用场景越多，需要被包装的能力也越多。懂AI的程序员和类程序员创作者，会把Agent能力变成具体应用和稳定流程。普通用户未必直接拥有一个OpenClaw或Codex，但他会在财务软件里整理账单，在办公套件里处理材料，在旅行产品和CRM里使用被包装好的Agent能力。

所以，AI不会让程序员这个角色消失。它会稀释单纯编码的门槛，同时提高工程化表达和产品封装的价值。未来更重要的人，会从传统程序员里长出来，也会从产品、运营和业务里长出来。他们的共同点是懂业务，懂AI，也愿意把复杂能力包装成稳定工作流。

## OpenClaw已经验证了这个结论

OpenClaw很适合作为观察对象。它的横空出世让“每个人都可以拥有个人Agent”的想象变得具体：连接服务，执行任务，保留记忆，通过日常通讯工具接收指令。它比传统Chatbot更像助手，也更容易让用户产生“终于有个东西替我干活了”的兴奋。

但OpenClaw越强，矛盾就越明显。它要做更多事，就需要更多权限。它越像个人管家，隐私、安全和成本问题就越难被忽略，后续维护也很难假装不存在。热度起来的时候，大家看到的是它能跑出多少惊艳效果；热度退下去以后，真正留下来的，大概率还是愿意配置环境、阅读日志、调整工作流的人。

这不是OpenClaw一个产品的问题。这类大众通用Agent经常把创造者工具包装成消费者产品。对创造者来说，裸露工作流意味着自由；对普通用户来说，裸露工作流意味着麻烦。创造者愿意为了可控性忍受复杂性，消费者只会在复杂性反复出现时变成创造者或者离开。

Hermes Agent的定位反而更务实。它面向的更像是类程序员群体：这些人可能不是职业程序员，但能理解任务拆分、权限配置、workflow沉淀和云端运行。它强调云上部署，也就没有把自己包装成一个本地全能管家。这种边界感很重要。它承认有价值的Agent需要稳定运行环境，也承认真正能用起来的自动化不会只靠一次漂亮演示。

几个月之后，再把OpenClaw和Hermes放在一起审视，我们会发现通用Agent的真实用户画像会不断收缩。第一波被吸引来的人很多，最后留下来的，是那些愿意把Agent当作工程系统来管理的人。

## ChatGPT和Codex的分工更务实

深入思考ChatGPT和Codex的产品设计，我觉得OpenAI明显想得更明白。它没有把所有东西都塞进一个通用Agent里，也没有因为Agent很热，就把每个功能都包装成“你的数字员工”。

ChatGPT仍然是默认的大众入口。它处理的是高频任务，门槛低，失败成本也相对低。用户可以从提问开始，把文件放进上下文，围绕材料一路追问细节；也可以通过Projects和Library把一个长期主题沉淀下来。再往前一点，定时任务负责主动触发，文件上下文负责保存材料，连接应用负责接入外部信息。这些轻量主动能力，其实已经覆盖了很多通用Agent宣称要做的事。关键在于，它没有要求用户先理解Agent架构。

Codex则是重工具箱。它需要仓库、环境、命令行和测试，也需要用户理解一次修改可能带来的后果。它不适合作为普通人的日常入口，但非常适合给硬核用户和工程化创作者提供执行力。ChatGPT和Codex连接起来以后，大众用户仍然从ChatGPT进入；真正需要重型工具的人，再把任务推进到Codex。

这个产品原则代表了OpenAI的深刻洞见。复杂能力不应该被无脑暴露给所有用户。越复杂，越需要边界、默认值、确认机制和恢复路径。普通用户需要简单入口和低失败成本，专业用户需要更高权限和验证环境。两个需求都真实存在，但用同一个裸露的通用Agent形态来解决，通常会把两边都搞得别扭。

很多通用Agent产品最容易犯的错，是把“AI可以做更多事”理解成“用户应该直接看到更多能力”。实际产品设计经常相反。AI越强，产品越要替用户吸收复杂性。用户不需要知道背后是不是Agent，他只需要知道这件事能不能稳定完成，错了能不能发现，危险动作前有没有确认，以及失败以后能不能恢复。

## 普通人会使用AI，但未必需要一个通用Agent

所以，对于普通人而言，AI会成为学习工具和办公工具，也会成为大量应用背后的自动化能力。未来很多人每天都会使用Agent能力，只是他们未必知道那叫Agent。

我质疑的是另一种更激进的想象：每个人都需要一个OpenClaw或Codex式的个人通用Agent，并且愿意长期维护它。这个假设高估了普通用户管理工作流的意愿，也低估了长期运行的成本。演示阶段，大家看到的是任务自动完成；使用阶段，用户面对的是权限和上下文，是验证与异常，也是token和安全。前者能带来迅速传播，但后者决定最终留存。

也许更合理的路径大概是三层。Chatbot继续作为普通用户的低门槛入口，专业Agent成为硬核用户和工程化创作者的工具箱，而大多数人的AI自动化需求则由具体应用包装后提供。这个路径没有“每个人都有数字员工”那么刺激，但更符合过去几十年技术发展的规律和不断重演的剧情。