你刚刚雇了一百万个“烂员工”
既然 agent 和人类,失灵的方式一模一样,那么将需要“agent 管理学”

01、"人比软件便宜"之后
For the first time in history, humans are cheaper than software.
有史以来第一次,人比软件便宜了。
这句话来自 Hebbia CEO George Sivulka 上周发的一篇长文,Marc Andreessen 当天转发"Interesting",原帖阅读量目前已过 215 万。

这篇文章的很多观点,用了一套曾经形容企业管理弊病的表述,重新命名了 agent 时代的问题:
- Token-maxxing 就是人海战术;
- loop 就是为了开会而开的会;
- 被浪费的 token,就是AI版的"人浮于事";
- Eval(一套给 AI 输出自动判分的测试体系)就是新的 OKR……
这篇文章,踩在了硅谷过去一个季度争论的交叉点上。上半场是 token-maxxing:Meta等诸多大厂员工,在内部排行榜上比拼谁烧掉的 token 更多。下半场是退潮:Gary Marcus 拿出 H200 租金三周跌四成的数据,Fortune 宣告 token-maxxing 已死……
AI 圈还每隔一阵,就冒出一个"XX工程"。先是 prompt engineering;接着是 context engineering;再接着是 harness engineering;如今是 loop engineering……Sivulka 的思路不一样:他说这些更是管理问题,不仅是工程问题。
他从 1841 年一场火车相撞事故讲起。当时美国铁路里程十年暴涨 120 倍,但调度全靠列车长个人判断,复杂度远远超出了人的能力,最终出现撞车事故。铁路公司被迫发明了一整套管理方法,现代管理体系就此诞生,铁路也因此成了占到股市市值六成的产业。
今天历史重演,我们给每个员工,包括最差的那个,都配上了随时能召唤无数 AI agent 的权限,和随便烧的算力预算。
结果呢?他估计80% 的 token 被浪费了,因为对好结果的定义还很模糊。
他给出的解法是 eval:给每个业务场景搭一套自动判分体系,让 AI 的产出有标准可循,就像代码要么跑通要么报错一样。
全文最终落到一个投资判断:下一个万亿美元机会,不属于想吃掉 21 万亿服务支出的 neofirm,而属于帮老牌企业把隐性流程,编码成 eval 和 agent 的**"AI 转型公司"**。
他拿Palantir 来举例,Palantir 市值三千多亿美元,如果按照"AI 让 SaaS 不值钱"的颠覆逻辑,Claude 都能写应用了,Palantir 本该第一个归零。但它没有,因为 Palantir 卖的从来不是软件,而是转型:深入一家企业、吃透它的业务、把它的流程编成系统,这就是下一个万亿机会的样子。
在AI如何影响就业的大辩论里,贝索斯说 AI 会制造劳动力短缺,Hinton 警告会取代大量岗位,Sivulka 站在贝索斯那侧,他还补了一个条件:新岗位会来,前提是有人学会管理。
至于该怎么管,Sivulka 把答案写成了七组对照,核心是一句话:agent 队伍和人类队伍,失灵的方式一模一样。
02、原文翻译:你刚刚雇了一百万个烂员工(You just hired a million bad employees)
作者:George Sivulka(Hebbia 创始人兼 CEO)
@gsivulka
大家原以为 AI 会取代人类劳动,结果恰恰相反。
有史以来第一次,人比软件便宜了(因为token开支惊人)。

头部公司的人均 token 支出
而且,AI 创造出来的岗位,比它消灭掉的还多。

采用 AI 之后的员工人数增长
技术每解决一个问题,总会制造出一个新问题。
19 世纪 30 年代,铁路的出现掀起了世界上前所未有的基建浪潮,美国的铁路里程在十年间暴涨 120 倍。
然后,系统失灵了。
1841 年 10 月 5 日,在马萨诸塞州的西部铁路(Western Railroad)上,两列火车因为一次简单的调度失误迎头相撞,酿成致命事故。
随着铁路网络越来越复杂,光靠列车长个人,已经无法保障行车安全。于是铁路公司开始了长达几十年的努力:给每个区域配备管理者,在组织内部设立新的岗位,建立起层级分明、汇报线清晰的体系。
现代管理就此诞生。靠着这套体系,铁路成了世界上第一个十亿美元级的行业,巅峰时期占到整个股市市值的六成左右。
如今,AI 正在让系统再次失灵。
我们刚刚给每一个员工,哪怕是最烂的那个,都配上了无限"人手"和无限预算。
管理 AI 比管理人更难,因为 AI 会把一切失灵瞬间规模化。好在,历史有先例可循:
Agent 队伍和人类队伍,失灵的方式一模一样。
理解这两者之间的七个关键相似之处,将解锁 AI 价值创造的下一个万亿美元。

一、Token-maxxing 就是人海战术
Token-maxxing这波火爆,从爆红到熄火,前后不到一个月。
但问题从来不在 token 烧了多少。
人们在 token 上花这么多钱,是因为他们根本不知道该怎么用。
100个员工里,大概只有一个懂得怎么给 AI 喂上下文。这样的人是稀有物种:既能把流程讲清楚,又有耐心去体谅被污染的上下文窗口,而光是能听懂"上下文窗口被污染"是什么意思的,其实也没几个。
把 agent harness 交到剩下那 99 个人手里,他们产出的只会是"loop"。
二、Loop 就是为了开会而开的会
不管是在 Claude Code/Cowork、Copilot、Karpathy 的 Autoresearch,还是随便哪个 harness 里,loop 都只是一块创可贴,它掩盖的是:几乎没人能把 prompt 写明白。
Loop 是用蛮力去弥补人的不足。Agent 之所以要一遍遍调用自己来修正自己,只是因为人从头到尾就没把任务说清楚,于是蛮力成了系统往前走的唯一路径。而这一切的根源,是人一开始就没能真正理解任务本身。
你是在为烧 token 而烧 token。

三、被浪费的 token,就是 AI 版的"人浮于事"
今天的大多数公司,都管理不善。
很多员工对业务毫无实质影响。他们是机器上的齿轮:在每一层盖章放行,再招来更多齿轮,供养这台为了存在而存在的机器。
他们就是在"loop"。
很多时候,把 loop 一刀砍掉反而更高效。马斯克裁掉了 X 八成的员工,公司反而表现更好。而私募股权的运营合伙人,做的就是这门套利生意:专挑虚胖的公司买下来,挤掉水分,赚走差价,就这么简单。
就像 80% 的员工什么都没干一样,今天 80% 的 token 也什么都没干。
人会催生出更多的人,token 会催生出更多的 token。Loop,就是新时代的跑马圈地。

四、100X token 就是新的 10X 工程师
(译注:"10X 工程师"是硅谷流行的说法,指一个人的产出,能顶十个普通工程师的顶级人才。)
软件当年的承诺是:只写一次,低成本永远运行,不需要任何人盯着。AI 打破了这个承诺,软件一旦什么都能干,就没有一件事能干得稳定可预期了。
Token 的行为方式像极了一支员工队伍。而一旦你把 token 当员工看,AI 的种种承诺就开始崩塌:
- "Token 比人准确",但前提是 prompt 得写对。
- "Token 比人快",可重试 100 次之后,快就没有任何意义了。
- "Token 不搞办公室政治",可它们会用烧掉的 token 给自己圈地盘。
- "Token 不会辞职",可它们既活不过模型更新,也活不过会话重开。
- "Token 值得信赖",可它们出起错来自信满满、格式完美。
AI 真正胜过人类的地方只有一个:可扩展性。扩张人类队伍,要在招聘、入职、流失上花费巨大精力;而扩张 token,一瞬间就能完成。正因如此,token 一旦管不好,代价才会这么大;也正因如此,你必须找到那个 100X token的方法,把它规模化。
10X 工程师撑起了上一个时代的公司,100X token 将撑起下一个时代。
极少数员工,能让身边的人生产力提高 10 倍;token 也一样,任何一项具体工作,总有那么一段上下文,能把 AI 的工作量砍掉几个数量级。能给你 100 倍杠杆的 token,是真实存在的。
按平均值算,人比 token 便宜;但好的 token 一旦上了规模,就比人便宜了。
而管理的价值,就是让前者变成后者。

五、把上下文捂在手里,是人类保住饭碗的最新手段
AI 在公司内部,正撞上一个巨大的政治问题,而且这个问题只会越来越糟:员工不想把自己的独门绝活教给 AI。
他们开始回过味来:这些系统来这儿,可不只是为了"帮助他们"或者"提升生产力"。
看看 Meta:那些手握公司股票的员工,本来有巨大动力把 AI 做好,如今却因为公司拿员工的上下文当训练数据而怒不可遏。这可是在一家科技巨头……这场冲突,正是每个行业即将上演的剧情。

几百年来,那些只可意会的隐性知识,一直是打工人的护身符。中世纪的行会,对手艺守口如瓶。AI 是第一项这样的技术:开口就要工人把这一切交出来,而且几乎一次性交齐。
没有人会免费培训那个要取代自己的人。
手握 100X token 的人,恰恰最没有动力交出来。情感上、结构上、政治上,整个公司从骨子里就排斥这项技术,而它偏偏是对自己的未来最重要的一项。
六、Eval 就是新的 OKR
管理一支 token 队伍的最佳方式,和管理人类如出一辙:定义清楚"好"长什么样。
唯一一个脱离办公室政治的爆款 AI 用例,是写代码。它把蛋糕做大了,也让每个工程师都变得更强。
这背后的机制,就是 eval(指为特定任务搭建的自动化评分体系,用来衡量 AI 输出的质量)。今天 99% 的 AI 收入来自编程,因为编程自带 eval:代码要么跑得通,要么跑不通,没有中间地带。
更广泛的跨领域 AI 用例,只有等到有人把相应的 eval 建起来,才会真正上线。具体的 eval,比教员工写 prompt、给他们发一个聊天 harness 重要得多。有了 eval,AI 将吃掉经济中那些代码永远碰不到的部分。
管理的真功夫,是把模糊的人类流程,翻译成代码,把定性的东西表达成定量的。
一家公司的 eval 套件,也将成为最值钱的资产。
OKR 是把人类队伍产出拉满的关键钥匙;eval 将是 token 队伍的那把钥匙,而这支队伍,可以无限扩张。Eval,就是跑出 100X token 的路径。
更何况,不会有任何两家公司的 eval 是一样的,Eval 将成为竞争优势的核心。一个跑着通用 eval、用着通用 agent 的组织,谈不上任何优势。

七、下一个万亿美元的机会,是卖转型的公司
这几年,企业一直在为 AI 掏钱:跟基础模型厂商签用量合同,买现成的 AI 应用,搞内部自建。但所有这些,都掩盖着一个关于经济账的残酷真相:
至今,还没有谁真正把 AI 用得稳定可靠。
硅谷对这场失败深信不疑,信到最新的执念干脆成了:做空今天的商业形态。"Neofirm"(新型公司),或者叫"AI 原生服务",这类创业公司正在拿到融资,瞄准的是知识经济里 21 万亿美元的服务支出。背后的逻辑是:老牌公司深陷自己的政治和流程泥潭,永远不可能靠自己完成这场转型。
Neofirm 也许确实能制造竞争压力,倒逼"传统公司"(tradfirm)拥抱 AI。但最大的 AI 资产,依然躺在老牌公司体内:已经跑通的差异化流程,配上现成的分销渠道,随时可以规模化。
事实上,下一批最大的生意,吃的不会是存量的服务支出,它们会向现有玩家卖一种全新的增量服务:"AI 转型公司"的体量,将是任何 neofirm 的 10 倍。
"转型"听上去像个一次性项目。但这里藏着一个杰文斯悖论(效率越高,消耗反而越大):组织每落地一个用例,就会冒出十个新用例;一家公司 AI 化得越深,吃下的转型服务就越多,而可能性的边界,每天都在往前推。持续不断的 AI 转型,将成为留在牌桌上的唯一方式。
想想 Palantir。纸面上看,它是软件业里最容易被 Claude 颠覆的公司:市值五千亿美元(译注:不过今天 palantir 已跌至三千多亿美元),干的却是给企业手工搭建定制应用的活儿。按照那套让 SaaS 几乎丧失投资价值的逻辑,Palantir 应该比 ServiceNow 先归零。

但 Palantir 没有,因为它卖的从来就不是软件,而是转型。
只不过,转型这门生意本身,也早已不是 Palantir 当年的老样子。在一个 AI 优先的世界里,它不再只是本体(ontology)、定制软件,外加偶尔写一段定制 prompt。真正的功夫,是搭 eval、是把 token 用量压到最低、是把一门生意吃得足够透,透到能把它编成程序。
把每家公司的独特之处编码进 agent,将成为这个十年最大的经济任务。
八、是时候开始管理了 It's time to manage
AI 热潮的每个阶段,都有一句用来指路的流行口号。
先是"淘金热里要卖铲子",于是我们建了基础设施;再是要卖"服务即软件"(Service-as-a-Software),于是我们造出了 neofirm。如今基础设施够了,服务也够了,现在要干的是让火车准点。
是时候走进企业了:找出那些 100X token,把跑得通的 loop 记下来,把正在被大规模浪费的智能,用到该用的地方。
人类刚刚变得比软件便宜了。但不管是人还是软件,总得有人告诉它们该干什么。
最后,如果你也对这篇文章的观点感兴趣,或者有什么想与我们讨论的,欢迎交流:



