你刚刚雇了一百万个“烂员工”
For the first time in history, humans are cheaper than software.

01、"人比软件便宜"之后
For the first time in history, humans are cheaper than software.
有史以来第一次,人比软件便宜了。
这句话来自 Hebbia CEO George Sivulka 上周发的一篇长文,Marc Andreessen 当天转发"Interesting",原帖阅读量目前已过 215 万。

这篇文章的很多观点,用了一套曾经形容企业管理弊病的表述,重新命名了 agent 时代的问题:
- Token-maxxing 就是人海战术;
- loop 就是为了开会而开的会;
- 被浪费的 token,就是AI版的"人浮于事";
- Eval(一套给 AI 输出自动判分的测试体系)就是新的 OKR……
这篇文章,踩在了硅谷过去一个季度争论的交叉点上。上半场是 token-maxxing:Meta等诸多大厂员工,在内部排行榜上比拼谁烧掉的 token 更多。下半场是退潮:Gary Marcus 拿出 H200 租金三周跌四成的数据,Fortune 宣告 token-maxxing 已死……
AI 圈还每隔一阵,就冒出一个"XX工程"。先是 prompt engineering;接着是 context engineering;再接着是 harness engineering;如今是 loop engineering……Sivulka 的思路不一样:他说这些更是管理问题,不仅是工程问题。
他从 1841 年一场火车相撞事故讲起。当时美国铁路里程十年暴涨 120 倍,但调度全靠列车长个人判断,复杂度远远超出了人的能力,最终出现撞车事故。铁路公司被迫发明了一整套管理方法,现代管理体系就此诞生,铁路也因此成了占到股市市值六成的产业。
今天历史重演,我们给每个员工,包括最差的那个,都配上了随时能召唤无数 AI agent 的权限,和随便烧的算力预算。
结果呢?他估计80% 的 token 被浪费了,因为对好结果的定义还很模糊。
他给出的解法是 eval:给每个业务场景搭一套自动判分体系,让 AI 的产出有标准可循,就像代码要么跑通要么报错一样。
全文最终落到一个投资判断:下一个万亿美元机会,不属于想吃掉 21 万亿服务支出的 neofirm,而属于帮老牌企业把隐性流程,编码成 eval 和 agent 的**"AI 转型公司"**。
他拿Palantir 来举例,Palantir 市值三千多亿美元,如果按照"AI 让 SaaS 不值钱"的颠覆逻辑,Claude 都能写应用了,Palantir 本该第一个归零。但它没有,因为 Palantir 卖的从来不是软件,而是转型:深入一家企业、吃透它的业务、把它的流程编成系统,这就是下一个万亿机会的样子。
在AI如何影响就业的大辩论里,贝索斯说 AI 会制造劳动力短缺,Hinton 警告会取代大量岗位,Sivulka 站在贝索斯那侧,他还补了一个条件:新岗位会来,前提是有人学会管理。
至于该怎么管,Sivulka 把答案写成了七组对照,核心是一句话:agent 队伍和人类队伍,失灵的方式一模一样。
02、原文翻译:你刚刚雇了一百万个烂员工(You just hired a million bad employees)
作者:George Sivulka(Hebbia 创始人兼 CEO)
@gsivulka
大家原以为 AI 会取代人类劳动,结果恰恰相反。
有史以来第一次,人比软件便宜了(因为token开支惊人)。

头部公司的人均 token 支出
而且,AI 创造出来的岗位,比它消灭掉的还多。

采用 AI 之后的员工人数增长
技术每解决一个问题,总会制造出一个新问题。
19 世纪 30 年代,铁路的出现掀起了世界上前所未有的基建浪潮,美国的铁路里程在十年间暴涨 120 倍。
然后,系统失灵了。
1841 年 10 月 5 日,在马萨诸塞州的西部铁路(Western Railroad)上,两列火车因为一次简单的调度失误迎头相撞,酿成致命事故。
随着铁路网络越来越复杂,光靠列车长个人,已经无法保障行车安全。于是铁路公司开始了长达几十年的努力:给每个区域配备管理者,在组织内部设立新的岗位,建立起层级分明、汇报线清晰的体系。
现代管理就此诞生。靠着这套体系,铁路成了世界上第一个十亿美元级的行业,巅峰时期占到整个股市市值的六成左右。
如今,AI 正在让系统再次失灵。
我们刚刚给每一个员工,哪怕是最烂的那个,都配上了无限"人手"和无限预算。
管理 AI 比管理人更难,因为 AI 会把一切失灵瞬间规模化。好在,历史有先例可循:
Agent 队伍和人类队伍,失灵的方式一模一样。
理解这两者之间的七个关键相似之处,将解锁 AI 价值创造的下一个万亿美元。

一、Token-maxxing 就是人海战术
Token-maxxing这波火爆,从爆红到熄火,前后不到一个月。
但问题从来不在 token 烧了多少。
人们在 token 上花这么多钱,是因为他们根本不知道该怎么用。
100个员工里,大概只有一个懂得怎么给 AI 喂上下文。这样的人是稀有物种:既能把流程讲清楚,又有耐心去体谅被污染的上下文窗口,而光是能听懂"上下文窗口被污染"是什么意思的,其实也没几个。
把 agent harness 交到剩下那 99 个人手里,他们产出的只会是"loop"。
二、Loop 就是为了开会而开的会
不管是在 Claude Code/Cowork、Copilot、Karpathy 的 Autoresearch,还是随便哪个 harness 里,loop 都只是一块创可贴,它掩盖的是:几乎没人能把 prompt 写明白。
Loop 是用蛮力去弥补人的不足。Agent 之所以要一遍遍调用自己来修正自己,只是因为人从头到尾就没把任务说清楚,于是蛮力成了系统往前走的唯一路径。而这一切的根源,是人一开始就没能真正理解任务本身。
你是在为烧 token 而烧 token。

三、被浪费的 token,就是 AI 版的"人浮于事"
今天的大多数公司,都管理不善。
很多员工对业务毫无实质影响。他们是机器上的齿轮:在每一层盖章放行,再招来更多齿轮,供养这台为了存在而存在的机器。
他们就是在"loop"。
很多时候,把 loop 一刀砍掉反而更高效。马斯克裁掉了 X 八成的员工,公司反而表现更好。而私募股权的运营合伙人,做的就是这门套利生意:专挑虚胖的公司买下来,挤掉水分,赚走差价,就这么简单。
就像 80% 的员工什么都没干一样,今天 80% 的 token 也什么都没干。
人会催生出更多的人,token 会催生出更多的 token。Loop,就是新时代的跑马圈地。

四、100X token 就是新的 10X 工程师
(译注:"10X 工程师"是硅谷流行的说法,指一个人的产出,能顶十个普通工程师的顶级人才。)
软件当年的承诺是:只写一次,低成本永远运行,不需要任何人盯着。AI 打破了这个承诺,软件一旦什么都能干,就没有一件事能干得稳定可预期了。
Token 的行为方式像极了一支员工队伍。而一旦你把 token 当员工看,AI 的种种承诺就开始崩塌:
- "Token 比人准确",但前提是 prompt 得写对。
- "Token 比人快",可重试 100 次之后,快就没有任何意义了。
- "Token 不搞办公室政治",可它们会用烧掉的 token 给自己圈地盘。
- "Token 不会辞职",可它们既活不过模型更新,也活不过会话重开。
- "Token 值得信赖",可它们出起错来自信满满、格式完美。
AI 真正胜过人类的地方只有一个:可扩展性。扩张人类队伍,要在招聘、入职、流失上花费巨大精力;而扩张 token,一瞬间就能完成。正因如此,token 一旦管不好,代价才会这么大;也正因如此,你必须找到那个 100X token的方法,把它规模化。
10X 工程师撑起了上一个时代的公司,100X token 将撑起下一个时代。
极少数员工,能让身边的人生产力提高 10 倍;token 也一样,任何一项具体工作,总有那么一段上下文,能把 AI 的工作量砍掉几个数量级。能给你 100 倍杠杆的 token,是真实存在的。
按平均值算,人比 token 便宜;但好的 token 一旦上了规模,就比人便宜了。
而管理的价值,就是让前者变成后者。

五、把上下文捂在手里,是人类保住饭碗的最新手段
AI 在公司内部,正撞上一个巨大的政治问题,而且这个问题只会越来越糟:员工不想把自己的独门绝活教给 AI。
他们开始回过味来:这些系统来这儿,可不只是为了"帮助他们"或者"提升生产力"。
看看 Meta:那些手握公司股票的员工,本来有巨大动力把 AI 做好,如今却因为公司拿员工的上下文当训练数据而怒不可遏。这可是在一家科技巨头……这场冲突,正是每个行业即将上演的剧情。

几百年来,那些只可意会的隐性知识,一直是打工人的护身符。中世纪的行会,对手艺守口如瓶。AI 是第一项这样的技术:开口就要工人把这一切交出来,而且几乎一次性交齐。
没有人会免费培训那个要取代自己的人。
手握 100X token 的人,恰恰最没有动力交出来。情感上、结构上、政治上,整个公司从骨子里就排斥这项技术,而它偏偏是对自己的未来最重要的一项。
六、Eval 就是新的 OKR
管理一支 token 队伍的最佳方式,和管理人类如出一辙:定义清楚"好"长什么样。
唯一一个脱离办公室政治的爆款 AI 用例,是写代码。它把蛋糕做大了,也让每个工程师都变得更强。
这背后的机制,就是 eval(指为特定任务搭建的自动化评分体系,用来衡量 AI 输出的质量)。今天 99% 的 AI 收入来自编程,因为编程自带 eval:代码要么跑得通,要么跑不通,没有中间地带。
更广泛的跨领域 AI 用例,只有等到有人把相应的 eval 建起来,才会真正上线。具体的 eval,比教员工写 prompt、给他们发一个聊天 harness 重要得多。有了 eval,AI 将吃掉经济中那些代码永远碰不到的部分。
管理的真功夫,是把模糊的人类流程,翻译成代码,把定性的东西表达成定量的。
一家公司的 eval 套件,也将成为最值钱的资产。
OKR 是把人类队伍产出拉满的关键钥匙;eval 将是 token 队伍的那把钥匙,而这支队伍,可以无限扩张。Eval,就是跑出 100X token 的路径。
更何况,不会有任何两家公司的 eval 是一样的,Eval 将成为竞争优势的核心。一个跑着通用 eval、用着通用 agent 的组织,谈不上任何优势。

七、下一个万亿美元的机会,是卖转型的公司
这几年,企业一直在为 AI 掏钱:跟基础模型厂商签用量合同,买现成的 AI 应用,搞内部自建。但所有这些,都掩盖着一个关于经济账的残酷真相:
至今,还没有谁真正把 AI 用得稳定可靠。
硅谷对这场失败深信不疑,信到最新的执念干脆成了:做空今天的商业形态。"Neofirm"(新型公司),或者叫"AI 原生服务",这类创业公司正在拿到融资,瞄准的是知识经济里 21 万亿美元的服务支出。背后的逻辑是:老牌公司深陷自己的政治和流程泥潭,永远不可能靠自己完成这场转型。
Neofirm 也许确实能制造竞争压力,倒逼"传统公司"(tradfirm)拥抱 AI。但最大的 AI 资产,依然躺在老牌公司体内:已经跑通的差异化流程,配上现成的分销渠道,随时可以规模化。
事实上,下一批最大的生意,吃的不会是存量的服务支出,它们会向现有玩家卖一种全新的增量服务:"AI 转型公司"的体量,将是任何 neofirm 的 10 倍。
"转型"听上去像个一次性项目。但这里藏着一个杰文斯悖论(效率越高,消耗反而越大):组织每落地一个用例,就会冒出十个新用例;一家公司 AI 化得越深,吃下的转型服务就越多,而可能性的边界,每天都在往前推。持续不断的 AI 转型,将成为留在牌桌上的唯一方式。
想想 Palantir。纸面上看,它是软件业里最容易被 Claude 颠覆的公司:市值五千亿美元(译注:不过今天 palantir 已跌至三千多亿美元),干的却是给企业手工搭建定制应用的活儿。按照那套让 SaaS 几乎丧失投资价值的逻辑,Palantir 应该比 ServiceNow 先归零。

但 Palantir 没有,因为它卖的从来就不是软件,而是转型。
只不过,转型这门生意本身,也早已不是 Palantir 当年的老样子。在一个 AI 优先的世界里,它不再只是本体(ontology)、定制软件,外加偶尔写一段定制 prompt。真正的功夫,是搭 eval、是把 token 用量压到最低、是把一门生意吃得足够透,透到能把它编成程序。
把每家公司的独特之处编码进 agent,将成为这个十年最大的经济任务。
八、是时候开始管理了 It's time to manage
AI 热潮的每个阶段,都有一句用来指路的流行口号。
先是"淘金热里要卖铲子",于是我们建了基础设施;再是要卖"服务即软件"(Service-as-a-Software),于是我们造出了 neofirm。如今基础设施够了,服务也够了,现在要干的是让火车准点。
是时候走进企业了:找出那些 100X token,把跑得通的 loop 记下来,把正在被大规模浪费的智能,用到该用的地方。
人类刚刚变得比软件便宜了。但不管是人还是软件,总得有人告诉它们该干什么。
最后,如果你也对这篇文章的观点感兴趣,或者有什么想与我们讨论的,欢迎交流:



