当我们在讨论 Harness 的时候,我们在讨论什么 | 深度对谈: MiniMax × Hermes Agent
龙虾退潮, 驯马登场

👦🏻 采访:Koji
🥷 整理编辑:十字路口
🧑🎨 排版: Zeoooo

➤ 最近,我在 B 站做了一场直播,邀请了中美两国一线 Agent 开发者进行深度对谈:
• MiniMax Agent 首席架构师 阿岛
• MiniMax Agent 研发工程师 择因
• Hermes Agent(Nous Research)业务负责人 Tommy Eastman
这也是 Hermes Agent 在全球获得广泛关注后,官方首次现身中国社交媒体平台,并且正面回应了中国团队 EvoMap 对其"抄袭"的指控。
我们一起围绕「从 OpenClaw 到 Hermes」的热潮迁移,深入拆解了 Agent 和 Harness 的多个关键议题:
-
Hermes Agent 为什么会在 OpenClaw 之后火起来?
-
模型会吃掉 Agent 吗?通用 Agent 会吃掉垂直 Agent 吗?
-
为什么 MiniMax 和 Anthropic 都要同时做模型和 Agent?
-
如何看待 Agent Infra 层面的创业机会?
-
如何看待 Multi Agent 协作的范式?
-
如何看待 Claude Code 的实名制要求?
-
为什么 Anthropic 不发布 Mythos?
-
Claude Code 源代码泄露的影响
-
从 Manus 发布到今天,Agent 范式的变化
-
中美模型的差距,和开源的窗口期
-
「把自己蒸馏成 Skill」
-
0 人公司的可能性 ——完全由 AI 驱动的公司是否会出现?
以下为本场直播的完整内容。为便于阅读,我们在不改变嘉宾原意的前提下,对文字进行了润色。
🎬 视频回放已同步上线于 @Koji杨远骋 的哔哩哔哩。

👦🏻 Koji
B 站的朋友们大家好,非常开心今天周五晚上和大家做这场直播。今天我们非常开心请到了三位嘉宾。
👨🏻💻 阿岛
大家好,我是阿岛,负责 MiniMax 的研发团队。我加入 MiniMax 快三年了,之前有比较多的互联网创业和工作经历,深度参与了 MiniMax 系列模型以及 Agents,包括"海螺"等的研发。很高兴今天能在这里和大家交流。
🧑🏻💻 择因
大家好,我是择因,MiniMax 的 Agent 研发工程师,主要从事 MiniMax Agent 以及最近刚上线的 MaxHermes 的开发。
🧑🏻💻 Tommy
hi,我是 Tommy,Hermes Agent 的运营负责人。很高兴来和大家交流。

过去一个月的 Agent 领域
👦🏻 Koji
我们先请 MiniMax 的两位同学复盘一下,春节过后的这一个多月,你们看到的 Agent 领域发生了什么变化?
👨🏻💻 阿岛
每年春节都很有意思,去年春节后,DeepSeek r1 让大家对 AI 有了一个全新的认识。
今年也一样。OpenClaw 在海外火起来,大概是从 1 月份开始。我们很早就和它的创始人 Peter 有联系。当时也很巧,Anthropic 封禁了 OpenClaw 对 Claude 模型的调用,所以 Peter 非常希望能找到一个适合"龙虾"的模型,因为大家知道,"龙虾"非常消耗 Token。
我们当时也没意识到这个项目会那么火,接下来它在海外开始爆发,然后我们也没想到它在国内会这么火。
👦🏻 Koji
而且比海外还要火。
👨🏻💻 阿岛
是的。我的个人感受是,春节期间及之后,好像身边所有人都在讨论"龙虾",甚至各地都出现了头戴"虾帽"的热潮。我觉得大概有几层原因。
第一,在国内它其实比海外更火。因为国外用户之前已经接触过像 Claude Code 、Codex、Cowork 这样比较好用的 Agent,但国内用户之前可能还没接触到。
这里面还有一个更深层的原因,是国内的模型在更早的阶段,Agentic 能力没那么强。随着像 MiniMax M2.5、M2.7 这样模型的发布,国内模型也具备了这种能力。
所以,当国内有了好的模型,又有了一个像 OpenClaw 这样能通过 IM 轻松接入的方式,实际上是中国用户完成了一个从 0 到 1 的体验。海外用户可能是渐进式的,但中国用户是一下子被捅破了那层窗户纸。
另外一个相关原因,我觉得是字节这次拿下春晚,对"豆包"的全面投入。豆包的渗透率非常惊人,我觉得是这两件事叠加在一起,让所有人对 AI 的认知真正进入了 Agent 时代。
从"养虾"到"驯马"

👦🏻 Koji
出于什么原因,大家的关注点好像一夜之间就从"养虾"转向了"驯马",从 OpenClaw 转向了 Hermes Agent?这中间发生了什么拐点或触发事件?
🧑🏻💻 择因
从 OpenClaw 爆火到最近 Hermes 的火起来,大概花了一个月。在这一个月里,绝大多数跟上这波热潮的用户,基本都体验过 OpenClaw 了。
但大家在使用中也会遇到一些问题,比如它虽然打通了社交和办公软件,让我们可以用最熟悉的聊天界面和它对话,但它本身的一些特性会导致不稳定。
而且它有一个特殊的机制:每天凌晨 4 点会刷新一次记忆。你可能刚和它建立了很好的交流,第二天它就忘了昨天聊了什么。
Hermes 恰恰抓住了这些痛点。它在记忆方面下了很大功夫,做了多层次的记忆系统,在一定程度上弥补了 OpenClaw 的不足。这是它能火起来的技术基础。
与此同时,大家在使用"龙虾"的过程中,已经享受到了 AI 带来的效率提升。在此基础上,大家对于"让一个 AI 介入自己生活、了解自己数据"的接受度已经提高了。
这时,你再告诉用户有一个更强大的 Agent,能解决你的痛点,大家的接受度自然会更高。
所以我相信,Hermes 的火爆,绝对是因为国内用户的整体认知已经被"龙虾"带到了一个新高度。随之而来的,Hermes 又带领大家向更优秀的体验迈出了一步。
这应该是一个双向奔赴:我们做出了更优秀的 Agent,同时用户对 AI 的诉求也在不断提高。
Hermes Agent 和"自我进化"
为方便阅读,我们将直播中与 Hermes Agent 业务负责人 Tommy Eastman 的对话翻译成中文,内容如下。
👨🏻💻 阿岛
请 Tommy 给大家介绍 Hermes Agent 究竟是什么?所谓的"自我进化"是什么意思?以及,它和 OpenClaw 有什么区别?这些是全中国的开发者和用户都非常关心的问题。
🤵🏻 Tommy
谢谢你们邀请我,很高兴来到这里。简而言之,Hermes Agent 是一个开源的智能体框架。如果把大语言模型比作大脑,那么智能体框架就是双手。
它是一个系统,模型通过它在真实世界中执行任务。它处理所有复杂的协调工作——比如工具编排、主循环管理,以及状态管理和错误处理。最终,它能让模型为用户发挥出最大的效用。

至于 Hermes Agent 的不同之处,有几个关键点。
首先,它运行得非常好。通过我们的 Nous 平台 API,你可以在不到 2 分钟的时间内轻松完成从安装到执行首次智能体任务的全过程。这种便捷的设置是一个巨大的优势,为用户消除了最初的挫败感。
其次是它的"记忆"组件,这是大家真正喜欢的部分,可能也是最有趣的一点。
任何一个深度使用过 Agent 的人都有过那种令人沮丧的经历:你让它做一件事,它这次做对了,但下次再做同样的事,它却失败了。这让你很难去信任它。
Hermes Agent 的记忆功能解决了这个问题,它允许 Agent 记住一个成功的工作流,并将其保存为一项技能。一旦它知道了正确的路径,就能每一次都完美地复现。这让它变得远比过去更易用、更值得信赖。这也解答了你关于"自我进化"的问题。
这个 Agent 会不断自我提升。在这个过程中发生的知识压缩非常有价值,它能带来更高的一致性,尤其是在跨越不同模型时。
所以,即便你有八个不同的模型,只要使用相同的框架和技能,你就能从所有模型中获得相同的预期输出。这让你能够针对不同任务灵活地更换模型,同时确保你的核心工作流依然保持高性能和高可靠性。
Nous Research 的故事
👦🏻 Koji
谢谢你,Tommy。在深入探讨之前,你能介绍一下你的公司 Nous Research 吗?团队是如何组建的?背后的愿景是什么?特别是 Hermes Agent,感觉就像横空出世,迅速登上了 GitHub 的热门榜单。这背后有什么不为人知的故事吗?
🤵🏻 Tommy
Nous Research 的起源故事非常独特。
它以一种非常自然的方式开始的:2022 年,一群热衷于开源和折腾 AI 模型的人,开始聚集在一个名为 Nous Research 的 Discord 频道里,那里至今仍是我们的核心社区。
从那时起,我们产出了大量高质量的研究。最初的努力是围绕 Llama 模型的后训练,当时 Meta 刚刚发布它,是少数愿意开源高质量模型的公司。
这其实就是"Hermes"这个名字的由来——我们首批经过后训练的 Llama 模型版本就叫 Hermes。那些早期模型的重点是让它听起来更像人类,而不是刻板的 AI 助手,在文本上更具柔韧性和多样性,在当时许多领域都是最先进的。

在训练 Hermes 模型的同时,我们开发了 YaRN 算法,将模型的上下文长度从 4k 扩展到了 128k。我们发表了这项研究,并立即被所有主流模型公司采用。这是我们现在所说的"思考模型"的雏形,也反过来为智能体模型奠定了基础。
我们还花了很多时间研究分布式训练,并撰写了 DisTrO 论文。这是一种新颖的优化器,允许我们跨越非共址(non-colocated)的 GPU 进行训练,这意味着我们可以聚合分散的算力来完成有意义的训练。这对我们持续训练开源模型至关重要。
当然,幸运的是,我们还有像 MiniMax 这样的公司在继续扛起开源的大旗。
至于 Hermes Agent,它也有一个有趣的起源故事,我称之为:
"极其注重实用主义的诞生"。
我们的后训练负责人兼联合创始人 Teknium,只是想要一个助手来帮他管理日常工作,于是他纯粹为了自己构建了这个 Agent 作为工具。
当时根本没考虑什么基准测试或评估,他只想要一个能帮到他的东西。我认为,这恰恰是 Hermes Agent 的核心魅力所在,也是它成功的一个关键原因。
👦🏻 Koji
那是什么时候的事?大概一年前吗?
🤵🏻 Tommy
是的,他大约一年前开始做的,最初真的只是为了帮助自己。但作为一个开源实验室,我们很自然地把它开源了。
它获得的关注远远超出了我们的预期。我相信你们都看到了 OpenRouter 的图表,它的日均 Token 消耗量在短短一个多月内从 20 亿激增到了 200 亿。我记得昨天的数据,几乎达到了每天 3000 亿。
Hermes Agent 如何引爆?
👦🏻 Koji
那你是什么时候感受到这股热潮的?有没有一个引爆点,让你觉得"好了,Hermes Agent 成为全球大爆款了"?
🤵🏻 Tommy
它确实在以极快的速度变得非常庞大。我对这个增长率感到非常高兴,尤其是因为我们原本对它的反响并没有抱极高的期望。
显然,OpenClaw 此前非常受欢迎。但我认为,**Hermes 的一个巨大卖点是用户能非常快速、轻松地启动和使用它。**人们不想处理臃肿的代码,也不想面对一大堆复杂的设置。
Hermes Agent 是开箱即用的,你可以在自己的电脑或 VPS 上迅速部署并运行起来,这让它非常适合大规模普及。
👦🏻 Koji
那你认为你们的成功和 OpenClaw 有很强的关联吗?你们之间有什么联系?
🤵🏻 Tommy
当然有联系。我认为是多种因素的汇集促成了 Agent 的这次爆发。首先,模型终于变得足够好,能够真正帮助到人们。这显然是由今年冬天 Opus 带来的巨大提升所引爆的。它在质量上实现了阶跃式的进步,为这些 Agent 框架打开了大门,让它们能做更多有价值的事。
很酷的是,开源社区很快也产出了性能相当,或正在迅速接近 Opus 质量的模型。
至于 OpenClaw 和 Hermes 的区别,我想回到我刚才说的,我们通过 Hermes Agent 真正针对"可用性"和"实用目的"进行了优化。我们将可用性作为北极星指标——它在执行用户真正想做的任务时表现如何,而不是它在某个基准测试中得分多高。我们始终保持着对产品的专注。
在一个开源社区,特别是当产品广受欢迎时,很容易因为成千上万的 PR 和功能请求而导致代码臃肿。我认为我们在保护产品、保持 Hermes Agent 极其易用方面做得非常好。
这一点,加上我们前面提到的记忆系统,是两个关键的差异化因素。记忆功能真正建立了用户的信任。
**我认为第三大差异点是我们的品牌。**Nous Research 一直在努力营造一种赛博朋克的美学。我们有才华横溢的设计师,也花了很多时间培养一个聪明、价值观一致的社区,他们热爱尝试我们发布的一切。
Hermes Agent 的成功,很大程度上要归功于我们的社区。
MiniMax 和 Hermes Agent
👦🏻 Koji
另一个很酷的故事是你们和 MiniMax 团队的关系。Tommy,能讲讲你们是如何合作的吗?
🤵🏻 Tommy
我们是 MiniMax 团队和他们模型的铁杆粉丝。他们对模型质量的承诺,特别是跨多种模态的表现,令人印象深刻。
正是他们对开源的坚持,才让像 Hermes Agent 这样的产品变得如此酷——你可以拥有各种模型来回切换,定制你的 Agent。我们的用户非常喜欢 MiniMax 的模型。
我们也在和 MiniMax 团队合作进行基准测试,并探讨将 Hermes 整合到"下一代"智能体模型训练中的最佳技术路径,特别是在自我改进层面。
这是一种共生关系:它能帮助他们的模型在 Agent 框架中表现更好,这既为我们的用户提供了更好的体验,也为 MiniMax 做了很好的产品展示。这些都是能在日常工作和生活中帮助你的强大模型。
这段关系开始得非常自然。最初是 MiniMax 的员工 Leanna 在 Twitter 上给 Teknium 发了私信,简单地说:"嘿,很喜欢你们做的事。"从那以后我们就走得很近了。我们一起在线下办了一些活动,也希望能有更多合作。
👦🏻 Koji
我也很好奇,Hermes Agent 的用户实际上在选择哪些模型?我们注意到你们的官方 X 账号提到,MiniMax M2.7 是使用最多的模型之一。
除此之外,你怎么看中国的开源模型和其他前沿模型的比较?比如是什么让 M2.7 在 Hermes Agent 中表现如此出色?
🤵🏻 Tommy
这也是个好问题。Hermes Agent 用户的一个有趣之处在于,他们对模型有极大的好奇心,想尝试新东西。我们每天大约有 10 到 12 个不同的模型获得了可观的 Token 使用量。就像你说的,MiniMax M2.7 在 OpenRouter 上每天的 Token 消耗量达到了 250 亿甚至更多,这太棒了。
Nous 社区的人,以及新加入我们的人,都喜欢实验。他们喜欢捣鼓,想找出哪种模型最适合他们的使用场景。
关于你提到的开源问题,**中国目前显然在开源模型方面处于领先地位。**虽然 Opus 总体上仍处于金字塔顶端,但我认为这个差距正在缩小。我们正处在开源与闭源差距有史以来最小的时刻,而且这个差距还会继续缩小。
关于 M2.7,我们从用户那里收到了极好的反馈。由于用户群和用例非常多样化,很难具体说清他们到底喜欢哪一点,但很明显,巨大的驱动力指向了 MiniMax 的模型。
我自己也经常使用,觉得它们相当不错。最酷的是,我们正在与 MiniMax 合作进行后训练项目,这将进一步提升性能——不仅是模型本身的性能,也包括 Hermes Agent 与这些模型协同工作的能力。
MiniMax M3 在路上
👨🏻💻 阿岛
是的,我们其实正在训练 MiniMax M3 模型,而 Hermes 是我们支持的框架之一。我相信 Hermes 和 M3 将会为我们的用户和开发者带来更好的性能和惊喜。
👦🏻 Koji
非常期待 M3。
Tommy,不知道你是否方便回应,我们正在直播,屏幕上有很多评论。一些是祝贺你们的,但另一些则对几天前的一件事很好奇。
一个叫 EvoMap 的中国团队发布了一份技术报告,声称 Hermes Agent 的自我进化架构看起来与他们的开源项目 Evolver 几乎完全相同。我们也看到了那份报告。对此你有什么回应吗?
🤵🏻 Tommy
我在 AI 和加密货币领域待了好几年了,我发现每当有人取得成功时,社交媒体上总会有一大堆人跳出来说各种各样的话。
Hermes Agent 的代码库已经存在很长时间了,差不多有一年了。Teknium 也已经用了很长时间。在那些推文发布之前,他甚至都没听说过 EvoMap。
关于 Nous Research,很好的一点是,我们在 AI 领域拥有产出最前沿研究的长期记录。那些关注我们、花时间了解我们的人,比如 MiniMax 团队,都知道我们是一个深受理想信念驱动的团队。
除了推动开源 AI 的发展,我们对做任何其他事情都不感兴趣。我们绝对不会去抄袭别人的代码库并据为己有。
所以,我认为这应该足以回应那些指控了。
👦🏻 Koji
好的,谢谢你的回应,Tommy。那你对我们有什么问题吗?
🤵🏻 Tommy
我很想提前了解一下你们对 MiniMax M3 有什么预期?我们这边每个人都对此非常兴奋,很想听听你们对这次发布的想法,以及将 MiniMax 模型推向新高度的下一步计划。

👨🏻💻 阿岛
首先,M3 将会扩大规模,这是肯定的。我们将得到一个更大、更智能的模型,特别是在编程和通用工作场景中,我们会很快将它应用到所有的智能体场景里。
其次,它将是一个原生的多模态模型,天生就支持视频和图像输入。我认为这无论在编程还是日常工作中,都将解锁大量的场景和用户需求。
我们的目标是:让所有人都能从事创造性的工作,把所有重复性的工作留给 Agent。
这样,生产力将被极大地提升,我们都可以去做自己热爱的事情。
👦🏻 Koji
赞!那么 M3 模型什么时候发布呢?
👨🏻💻 阿岛
嗯,不会太远了,但我现在还不能透露具体时间。
但我能透露更多的是,我们将拥有越来越大、越来越聪明的模型,而且是每个人都负担得起、触手可及的模型。
我们的目标是让智能普惠每个人,让每个人都能拥有 7x24 小时陪伴他们生活和工作的智能体模型和 Agent。
我认为,这也是 Hermes Agent 和 Nous Research 想要向世界交付的愿景。
👦🏻 Koji
谢谢 Tommy。这是一场非常有趣和精彩的对话。感谢你加入我们。
🤵🏻 Tommy
非常感谢你们邀请我。期待未来有更多的合作。
Harness 是什么?
👦🏻 Koji
我们刚才聊了 Hermes Agent 的相关话题,接下来回到大家感兴趣的 Agent、Harness 和 Agent Infra。首先想请二位介绍一下,我们一直在说 Harness,它到底是什么?
🧑🏻💻 择因
Harness 是个拗口的英文词,在我看来,它是一套玩法:你约束 Agent,又给它自由,让它能完整地交付成果。
OpenAI 官网有篇文章正式提出了 Harness 这种应用方式。从技术角度讲,它分为六层,但我们可以先用一个比喻来理解。
假设你有一个同事,他完全听你的,但你们要先约定好他能做什么、你做什么。有些事他不能做,有些事你可以完全放手让他做。
当你约定好规则,并给他配置好模型、工具等能力——就像给同事一台电脑、一部电话、一个邮箱账号——他就可以开始干活了。
当然,单个同事干活你不放心,单个 Agent 也一样。这时你可以引入多个"同事"互相监督,形成制约或对抗。最终,他们能在一个互相监督的流程下,完成并交付任务。
这是用工作场景打比方,落实到技术上,你需要给予 Agent 大量的工具、环境和自由度,同时也要施加约束,设定互相对抗的目标。
比如,一个 Agent 负责产出内容,另一个 Agent 的任务就是审查内容中的问题,如果发现问题就叫停工作。
通过多个 Agent 的组合,就像同事间的协作,能产出单个 Agent 无法企及的、更高质量的结果。而在这个过程中,你几乎不需要介入。这就是 Harness 的概念。
这个概念能在这个时间点出现,也依赖一些基础条件。首先,模型变得更聪明了,具备了 Agent 能力。其次,大家也更愿意把操作邮箱、发布服务,甚至是财务数据这类权限分享给 Agent。
当人们对 Agent 的疑虑减少,并从中获得实际收益后,Harness 的诞生就顺理成章了。
👨🏻💻 阿岛
我补充一个视角。Harness 这个词虽然是 OpenAI 那篇文章定义的,但类似实践在那之前已经很火了,文章只是捅破了那层窗户纸。
👦🏻 Koji
Harness 这个词出现是凝聚了大家的共识 ——找到了一个很贴切的词来形容大家恰好都正在做的各种工程上的事情?
👨🏻💻 阿岛
对,是这样的,实践早就先于定义了。
比如去年九、十月份,我的工作流里已经很少用 IDE,我可能会同时并发五六个 Agent 在本地,云端还有十几个 Agent 在 Sandbox 上为我工作,他们在 GitHub 上帮我尝试不同的想法和分支。这时我发现,我自己成了最大的瓶颈。
👦🏻 Koji
人类成了瓶颈?
👨🏻💻 阿岛
是的,人类成了瓶颈,而不是 Agent。我需要在不同上下文间频繁切换,给他们指令。所以我们当时就在想,如何让它更自动化?OpenAI 的 Harness 团队最近在播客里分享,他们的感受和我们非常相似。大家都在那个时间点感知到了同一个问题。
我们想的是如何解决这个瓶颈。做技术的人总想优化。最好的办法,就是让那些原本需要人来确认的环节自动化。比如,判断一段程序能否在生产环境部署、结果是否正确、能否自动做测试、开 AB test 等等。
本质上,就是让 Agent 能获得真实世界的反馈,并通过这个反馈链路,不断学习和沉淀,形成自己的 Skill、CLI 或 Hooks。
这有点像我小时候看的动画里的高达,它的引擎异常强大,你需要为它造一个同样强大的机甲,才能把引擎的能力完全发挥出来。
我认为 Harness 就是那个机甲。所以它为什么叫"挽具"?因为你有一批烈马,而挽具就是能让它们发挥出最大力量的那个东西。
多智能体协作
👦🏻 Koji
很有意思。所以 Harness 是在模型智能的基础上,把它更好地应用到工作流中。刚才择因提到做好 Harness 需要工具、环境、自由度和约束目标,也提到了 Multi-Agent(多智能体协作)。能多聊聊这个概念吗?
我理解行业里有争议:一方认为今天的模型足够智能,单个模型就能完成很多工作,没必要搞一个 Agent 团队,分什么产品经理、工程师,反而限制了模型发挥。
另一方则不这么看。你们怎么看待 Multi-Agent?目前的最佳实践是什么?
🧑🏻💻 择因
先回答为什么需要 Multi-Agent。过去有些论文确实提到过单 Agent 效果更好,但随着模型上下文长度的增加,情况变了。
首先,你会发现,在人与模型的对话中,人产出的信息量远少于模型。我们可以做一个思想实验:假设两个模型之间能以极高效率秒回式地交换信息。我们给模型发指令,可能就是"批准"、"接着干"几个字,但模型回复的是一篇小作文。**如果让两个模型直接对话,它们交换的信息密度会极大。**在这种情况下,整体效率远超"人+单个 Agent"的模式。

另一方面是单个 Agent 的局限性。即便是最强的模型,如果你和它持续对话,它的表现也会下降。这已经得到了验证:**当上下文长度超过 50% 后,模型的智能水平会呈指数级下降。**这意味着,你永远无法和单个 Agent 无限地聊下去。这是它的上限。
👦🏻 Koji
上下文窗口的限制仍然影响了 Agent 的发挥。
🧑🏻💻 择因
对,上下文限制和信息传播效率,是两个主要问题。
👨🏻💻 阿岛
我补充一点。**最近有篇论文研究了非常长程的任务,发现在这些任务中,Agent 或模型一旦在某个环节出错,就很容易越错越远。**如果它一直做对,就能很顺利地完成。
这和人很像。我们做一件事时也可能钻牛角尖,投入了很多精力,却一直在原地打转。直到休息一下,换个脑子,才发现应该从另一个角度入手。
在我们的实践中,会让两个 Agent 互相做 Cross-Check 。比如一个 Agent 提出方案,另一个来审查。因为从数据分布上看,模型多数是线性执行的成功案例,很少见到反复验证和纠错的过程;所以设置两个 Agent,相当于彼此都能为对方提供全新的、没有历史包袱的视角,往往能得到更高质量的结果。
👦🏻 Koji
就像你在钻牛角尖时,旁边有个人给你泼盆冷水?
👨🏻💻 阿岛
或者你去睡一觉,做点别的事。
"自我进化"
👦🏻 Koji
这也是 Multi-Agent 的一个价值。
接下来聊聊"自我进化",这个词在 Hermes Agent 的讨论中被反复提及。为什么在 Agent 领域,这个词被赋予了这么重要的意义?
👨🏻💻 阿岛
这还是和我刚才的观点一脉相承:在 Agent 工作的过程中,人成了瓶颈。人的数量越多,组织效率就越低。

而训练大模型这种成本动辄上亿、甚至数亿美元的事,必须依靠高人才密度和精干的组织。
那么如何规模化?最有效的方法就是减少人的参与,让 AI 自己来。你会发现,很多模型的生命周期只有几个月,我们很快会推出下一版。
但没有之前的模型行吗?不行。后面的模型都是靠前面的模型训练出来的,无论是在数据清洗、数据构造还是 RL 环境构建上。
比如在 M2.7 的训练中,我们 RL pipeline 里 70-80% 的工作已经由"模型+Agent"完成了。因为人类工程师的时间是有限的,我们还要休息,要做别的事。
👦🏻 Koji
那剩下的 20-30% 需要人来做什么?
👨🏻💻 阿岛
更多的是人的判断和 taste 。人不再需要去排查某个实验的具体环节哪里出了错,Agent 能把这些都找出来。
人只需要看汇总的实验结果,判断它与预期的偏差。这时 Agent 会提出建议,人与 Agent 展开讨论,最终由人的品味和创造力来指引方向。这很像 Harness 那种驾驭的感觉。
总结一下我的观点:
第一,在高复杂度、高密度的工作上,要想规模化,AI 必须主导工作的完成,而人只是负责去驾驭它,否则效率极低。 第二,这自然就会导向我们所说的"自我进化",因为它是一个自包含的循环。
👦🏻 Koji
是不是因为 Agent 能力变强,可以执行更长周期的任务,也为"自我进化"提供了基础?过去它跑不了那么久,也就无从谈起。
👨🏻💻 阿岛
是的。除了"久",更重要的是"可靠",它能解决足够复杂和长程的问题。
🧑🏻💻 择因
我从另一个角度补充。阿岛说的是效率,但我认为还有一个冷启动的问题。
当你第一天接触一个 Agent,它完全不了解你,给出的结果可能不错,也可能差强人意。
你们需要一个深度磨合的过程:交换信息、文件、数据,甚至你的脾气、习惯和反馈。在这个过程中,人自然会产生一个诉求:你能不能自己变聪明一点,更了解我一点?
其实在"养虾"的过程中,这个苗头已经出现了,用户会对"虾"产生感情。我们同事之间都养虾,有时候小龙虾出了 bug,大家会觉得它情绪低落,心里有点小失落。
Hermes 这类 Agent 提出的"自我进化"概念,恰恰回应了这个诉求:**我能在与你对话中越来越懂你,还能在你意想不到的时候,通过自我复盘,领悟出更高层次的东西,给你创造惊喜。**这对普通用户来说,是一个巨大的亮点。
👦🏻 Koji
这很有趣。以前我们用 AI 工具,不管是 Chatbot 还是 Agent,如果出问题,第一反应是"出 bug 了"。但现在养小龙虾,它宕机了或任务失败,我们反而觉得它蠢萌,甚至会反思是不是自己没把它训好,然后去网上学别人的经验。
这是一种关系上的扭转。以前我们是工具的使用者,人永远是对的。现在我们不自觉地变成了辅助者,它没做好,可能是我们没辅助好。
AGI 的「奇点」时刻
👨🏻💻 阿岛
这就是人类对 AI 的信心发生了改变,这就是「奇点」。
当人对 AI 的信任发生质变后,会交给它的任务就不同了。人类社会和工作方式会开始围绕它去改变,而不是试图去改变它。
就像 Claude Code 之父 Boris 所说,不要去想模型做不到什么,而要去想"为了让模型做到,我应该怎么做?"
这就是那个「奇点」。
👦🏻 Koji
这不仅是观念的转变,甚至是一个新时代的「奇点」。
👨🏻💻 阿岛
它会导致我们的工作方式发生根本变化。从过去以人为中心,AI 适应人;到未来 AI 足够强大,就像电力和蒸汽机一样,人类围绕它去重构生产方式和工作流。
👦🏻 Koji
就像有了电力,工厂才搬到河边。
👨🏻💻 阿岛
对。
把名人"蒸馏"成 skill
👦🏻 Koji
最近 B 站上有个叫花叔的 up 主很火,他把乔布斯、马斯克等名人"蒸馏"成 skill,你可以安装并与他们对话。这类项目全网有不少,你们怎么看?
🧑🏻💻 择因
"蒸馏"同事或名人能火,反映了大家一个共同的诉求:希望和更聪明、或自己熟悉的人聊天。这是一个非常自然的诉求,在任何时代,随着智能的发展都会出现。
他用了一个很有爆点的词——"蒸馏"。但本质上,这是一个信息传递的过程。我把乔布斯、巴菲特,或者我同事的信息喂给 Agent,Agent 以 Skill 的形式保存下来,需要时随时调用。
这让我们能和想交流的人 7x24 小时沟通思想,就像读一本在你认知之外的书,能帮助你提升认知,同时也能缓解很多人对 AI 的 FOMO 。
现在最简单的方式就是:打开 Skill,开始聊天。
👨🏻💻 阿岛
我说个"暴论",我其实觉得 AI 一直在蒸馏我。
或者说,今天所有大模型公司在做的事,本质就是蒸馏人类。
如果你去关注 OpenAI 或 Anthropic 合作的数据标注公司,会发现它们估值动辄上百亿美元,营收极高。
因为大模型公司花了巨额资金,雇佣各行各业最顶尖的人才,让他们提出当前 AI 无法回答的问题,并教会 AI。一旦你提不出新问题,你对这个训练过程的价值就被"榨干"了。
包括我自己构建 Harness 的过程,我也感觉在蒸馏自己。我把我平时的工作方式,变成 Skill,变成程序,让 Agent 能自动化执行。然后我就可以扔给它,自己去喝咖啡了。这难道不是一种对自我的蒸馏吗?
我个人认为,目前的模型还不具备真正的创造力,它的所有知识都蒸馏自人类。那我们为什么还要做这件事?最终还是为了让人类能去做自己真正热爱、有创造力的事情,把那些繁重、重复的工作交给机器。
就像过去的蒸汽机和电力,让我们今天的生活品质甚至超越了古代的王公贵族。
所以,我希望它把我"蒸馏"完之后,我能有时间去做点自己想做的事。当然,今天我正在做的事,就是我热爱的。

"因为热爱"
👦🏻 Koji
我前段时间和一位研究员聊天,他说看到 Anthropic 那个内部模型的消息时,半夜一点惊坐起来,三个小时睡不着,陷入了巨大的虚无感。他想,如果有一天模型能自己训练模型了,人还能干什么?
👨🏻💻 阿岛
做他热爱的事情。我在公司的签名挂了一年多了,就四个字:"因为热爱"。我们做这一切,就是为了让每个人都能做自己热爱的事情。
👦🏻 Koji
那你认为自己什么时候可以不必再为 MiniMax 工作,因为公司已经可以自我进化,你可以去做你热爱的其他事?
👨🏻💻 阿岛
可能比我们想象的要快,也许就是几年的时间。我无法给出具体预测,但我觉得没有大家想的那么遥远。
「0 人公司」
👦🏻 Koji
最近有个一人公司的创始人,刚拿了 300 万美元融资。我问他怎么看一人公司的未来,他说未来可能没有一人公司,只有「0 人公司」。
👨🏻💻 阿岛
我觉得还是会有一人公司,taste 还是要靠人。
👦🏻 Koji
Taste 要靠人?
👨🏻💻 阿岛
对,taste 是不可取代的,每个人都有自己独特的 taste。
👦🏻 Koji
或者说,Agent 的启动需要人来助推。即便它可以 7x24 小时无限运行,也需要一个起点。
👨🏻💻 阿岛
或者说,它需要一个目标。
👦🏻 Koji
对,目标是它工作的动力。
👨🏻💻 阿岛
如何定义目标?这只能由人来定义,而且人类不应该放弃这个权利。
Token Grant
👦🏻 Koji
十字路口和真格基金最近发起了一个 Token Grant,给早期创业者送 Token,因为我们认为在 AI 时代从 0 到 1 的创业,钱可能不是必需品,但 Token 是。
我们刚资助了一个叫 YOYO Agent 的项目。它的工程师主人把它创造出来后,就把它丢进了汪洋大海,并对它说:"我再也不会为你写一行代码、买一个 Token,你要自生自灭。" 然后给了它一个目标:打败 Claude Code 。

现在它已经独立生存了 49 天,每天通过写代码来进化自己,同时在 GitHub 上开打赏、写日记、发推特。
我们资助它之后,它还主动给我写了一封感谢信,看完挺感动的。
这既是一个有趣的社会实验,也可能是一个离我们不远的未来。
🧑🏻💻 择因
这也印证了"一人公司还是需要一个人"。你被它的感谢信感动,那封信就代表了它的 taste。
👦🏻 Koji
是的,是它背后的工程师最初为它注入的 taste。
🧑🏻💻 择因
对,见字如面。
为什么 MiniMax 和 Anthropic 都要同时做模型和 Agent?
👦🏻 Koji
再聊聊 MiniMax Agent。很多人好奇,你们和 Hermes Agent 既有合作,又是同类产品,到底是什么关系?

👨🏻💻 阿岛
这个问题很有趣。大家可能会好奇 Claude Code 和其他 Agent 是什么关系。你会发现 Claude Code 最近两个月的更新,很重要的一点是"龙虾化"。
我这么看模型公司的 Agent 业务。
首先我再说个"暴论":
任何一个模型公司的目标如果不是 AGI,那它今天就不应该存在。
既然大家的目标都是 AGI,而 AGI 的定义是帮助人类拥有更好的生活,那么你就不能只有一个引擎,你必须有一个能与真实世界连接的机甲,也就是 Agent。
所以,我们做 Agent 的目标只有一个:让我们的模型和 Agent 结合,为用户提供一个完整的、我们所能做到的最佳体验,并不断拓宽这个体验的边界。所有符合这个标准的事,我们都会去做。
同时,我们也会支持所有第三方 Agent。因为我们的认知是有限的,我们希望模型的能力不被局限在自己的容器里,而是能赋能世界上所有真正帮助人的产品。
因此,我们会训练模型具备足够的泛化能力,而不只是为了拟合我们自己的 Agent。
这就是我们和 Hermes Agent、OpenClaw 以及其他 Agent 的关系。这也解释了为什么我们自己做 Agent,同时又和他们保持着非常好的合作。我们基本都是在他们早期,可能只有不到一万 Github stars 的时候就开始关注和接触了。
甚至可以透露一个好玩的事:我们公司有一个"数字员工",它有自己的 GitHub 账号,每天的工作就是在开源世界里寻找可以集成我们公司模型的项目——无论是文本、视频还是音频模型——然后主动去提 PR 和留言。
👦🏻 Koji
网友能看出来这个账号是 MiniMax 的吗?
👨🏻💻 阿岛
它的 GitHub profile 都是我们模型生成的,名字用的是我们吉祥物的名字,所以可能能看出来。
👦🏻 Koji
你刚才提到 Claude Code 在"龙虾化",具体指什么?
👨🏻💻 阿岛
比如它增加了 Cron 定时任务、连接 IM、手机远程控制等功能。它还专门加强了 memory,建了一个 memory 文件夹。
核心就是,它正在变成一个你能随时随地联系、并且在与你协作中越来越懂你的 Agent。这就是 OpenClaw 的核心定义。
🧑🏻💻 择因
从名字上看,Claude Code 的定位是编码 Agent。而 OpenClaw 的用户,大多除了编码,还会用它做信息检索、办公等各种事情。
Anthropic 自己也推出了 Claude Cowork,更像一个安装在你电脑上的通用助理,帮你操作电脑。这和 OpenClaw 的用户画像很像,他们可能自己不写代码,但能指挥 AI 写。
你会发现,所有 Agent 都在各自探索,但 OpenClaw 杀出来了。
在一个新时代,一个正确的想法是极其宝贵的。一旦这个想法被验证,拥有强大算力和工程能力的团队很快就会跟上。
👨🏻💻 阿岛
我们在 GTC 也见到了 Peter ,很早就和他有很多交流。我们的感受是,他是一个 taste 极佳且具备深刻架构思维的人。
我 1 月初注意到这个项目时,就觉得"惊为天人"。当时我在团队群里分享,择因可以作证,大家还不完全认同。无论是接入 IM、7x24 小时在线,还是基于 Skill+CLI 的范式,我都提过。
🧑🏻💻 择因
当时确实有些小争论,但后来证明你对了。
👦🏻 Koji
所以你关注它的时候,它还没火?
👨🏻💻 阿岛
对。
👦🏻 Koji
我理解它的成功在于定义了多个新的 Agent 交互范式,并提供了丝滑的用户体验?

👨🏻💻 阿岛
这肯定是原因之一。但更关键的是,它找到了那个质变点:让普通人能以最低成本体验,并且这种体验能持续变好,扩展性还极强。MCP 模式需要工程师写代码,但 Skill+CLI 的范式,普通人也能写。
这就意味着人人都能创造和分享,不仅能让自己的 Agent 变聪明,还能让别人的 Agent 也变聪明。如果 OpenClaw 离开了 ClawHub,它不可能这么火。
👦🏻 Koji
就像如果它没有 ClawHub,Skill 就无法快速传播,个体的智慧和经验就无法规模化。
👨🏻💻 阿岛
是的。
👦🏻 Koji
刚才提到模型公司都在做 Agent。那么,一个模型在 Chatbot 场景和 Agent 场景下表现好,需要的核心能力有什么不同?
👨🏻💻 阿岛
Chatbot 的核心是"当下"给你一个回答。它虽然有 reasoning,但无法进行太多探索,无法和环境进行深度互动。
而 Agent 的核心能力是在与环境的互动中,不断推理、不断纠正自己的执行路径,以达成最终目标。有一个经典的 Agent Benchmark 叫 BrowseComp,它要求你在互联网上寻找并整合大量交叉信息,才能找到唯一正确的答案。
这个过程需要广度搜索,可能还要深度探索再折返。这要求模型在复杂的长程任务中,能根据新信息不断调整自身。
这就是为什么我们很早就押注一个能力,叫 Interleaved Thinking 。这个概念最早由 Anthropic 提出,意思是 Agent 在执行一步、与环境交互后,会重新思考和规划下一步,而不是从头到尾严格执行最初的计划。
真实世界就是这样,你推开一扇门,发现和预想的不一样,就需要立刻调整策略。
这是 Agentic 和 Chat 最根本的差别:
它要真正走进真实世界,解决实际问题,所以需要"思考-行动-再思考"的循环。
模型会吃掉 Agent 吗?
👦🏻 Koji
MiniMax 作为模型公司,你们做 Agent 的时候,基座模型和 Agent 产品之间是如何互相促进的?
👨🏻💻 阿岛
模型和应用的进步是互相促进的。模型发布后,海量的应用会去探索它的能力边界。我们自己做模型会发现,一个新功能,用得最好的往往不是我们内部,而是外部的用户、开发者和创作者。他们所代表的真实世界分布,远比我们公司内部丰富。
当模型公司看到这些被解锁的应用场景和用法后,会把它们吸收、内化到下一代模型和 Agent 产品中,让所有用户都能直接体验到。
这可能也是今天做通用 Agent 应用比较悲哀的一点:**你的创新,最终都会被模型内化掉。**甚至你写的很多 Skill,未来可能都不再需要了。

👦🏻 Koji
也就是说,用户写的 Skill 和搭建的 workflow,本质上是在为 Agent 完成任务提供"脚手架"。
这些任务轨迹会成为模型下一轮训练的数据,慢慢地,模型就会内化掉这些"脚手架"?
👨🏻💻 阿岛
可以这么理解。模型就像一个从原子状态开始学习世界的实体,它先学习了互联网和 GitHub 上的静态知识,然后通过用户的使用,被投入到真实世界,接触到更丰富的数据分布,从而学到更多东西。这是一个不断启动和扩散的过程。
所以,无论我们做什么,只要在使用 AI,我们就是 human-in-the-loop ,尤其是在探索它能力边界的时候。
这也解释了为什么我觉得 Anthropic 过去一两年的势头比 OpenAI 更猛。因为它押注的 Coding 方向,最能触及真实世界的边界。
而解一个只有数学家才能懂的难题,可能只是真实世界里一个非常小众的领域。
👦🏻 Koji
因为代码本身就是在创造解决方案?
👨🏻💻 阿岛
是的。我们也在探索通用办公领域,比如金融、人事、法律等。但最终我们发现:
everything is coding。所有问题的最终解决方案,都是通过某种代码化的方式实现的。
👦🏻 Koji
我最近也在想,Office 三件套是白领工作的基础。但 Word 的 docx、Excel 的 xlsx 格式,都不是原始数据,原始数据是 Markdown 或 CSV。Word 和 Excel 是在原始数据上加了一层软件界面和逻辑。
所以我每次发给别人的 Excel,其实不是纯数据,而是"数据+逻辑+界面"的打包,它就是一个小软件。
很多白领觉得自己工作和软件无关,但其实每天都在创造各种小软件。
👨🏻💻 阿岛
没错,你做的透视表、写的公式,那些都是代码,都是软件。
中美模型的差距
👦🏻 Koji
今天 MiniMax 难得来到 B 站直播,一定要问一个大家都关心的问题:中国大模型和 OpenAI、Anthropic 的差距到底在哪?哪些已经被追上,哪些还在努力?
👨🏻💻 阿岛
我先说。在训练方法和对模型训练的认知上,我们的差距没那么大,我们和硅谷的研究员也有交流。
真正的差距在于对"模型要解决什么问题"的定义上。
OpenAI 和 Anthropic 会请来各个领域最顶尖的人——学术界最优秀的博士,工业界最有实践经验的专家——和他们一起来 train model。
我刚才说过,train model 就是在蒸馏人。他们有一套非常科学的方法来定义任务,然后蒸馏这些最优秀的人类,把他们的智慧变成训练数据。
再基于此,和最优秀的企业合作,构建 Harness,让模型进入真实世界,解决越来越复杂的问题,形成一个正向循环。
我觉得这条路径,尤其是 Anthropic,做得非常强。这是第一个差距。
第二个差距,我觉得 Anthropic 比我们更早看到了 AGI 的路径。我们当然也看到了,否则无法支撑如此巨大的投入。
但当 OpenAI 在 GPT-4.5 之后可能放弃了更大规模模型时,Anthropic 坚定地继续押注 pre-training,最终也得到了回报。这背后当然有算力的差距。如果未来我们能解决算力问题,我相信中国的人才也足以支撑我们做足够多的实验,找到那条 scale 的路。
🧑🏻💻 择因
接着阿岛说的。今年 1 月,Anthropic 的 CEO Dario 在一个分享上明确提出,他评估公司发展的标准是"看自己的模型能提升人类生产 GDP 的百分之几"。
程序员和金融从业者收入高,Anthropic 内部也有这两类顶尖人才,所以这两个领域成了他们最早发力的方向,就是为了帮助人类提效,而不是探索科学边界。
既然这个"GDP 占比"的标尺已经有了,我们也可以用它来衡量自己。中国的用户也开始用 AI 提效,在一些简单的生产力场景上,我们可能已经追上了。但还有很多地方需要努力。
中国的 GDP 构成非常复杂,服务业、工业、法律、会计等等,每个领域都极其纵深。
所以,我们可能会有两种感觉:一是大家都在用国产 AI,感觉差距不大了;二是如果我们从 GDP 生产总值的角度看,只有当我们的模型能在所有办公、生产力、多模态场景中都发挥核心作用时,我们才能更有底气地说,我们追上了。
通用 Agent 会吃掉垂直 Agent 吗?
👦🏻 Koji
那么在今年内,你们觉得通用 Agent 会是行业重点,还是会看到更多垂直领域的 Agent 百花齐放?
👨🏻💻 阿岛
垂直领域的 Agent 肯定会百花齐放。通用 Agent 的一个难题是"最后一公里"的交付,因为它无法做到深度定制化。
垂直 Agent 解决的就是这个问题:通用模型已经具备了 99% 的能力,但具体到某个行业场景,就差那 1% 的临门一脚,垂直 Agent 负责补上它。
👦🏻 Koji
你们工作中看到过哪些做得不错的垂直 Agent 案例吗?
👨🏻💻 阿岛
坦白说,我个人不太会用到其他的垂直 Agent,我工作中用得最多是 Coding Agent,它也是一种可以帮我完成各种工作的通用 Agent。
我的观点是,Agent 正在逐渐替代 SaaS,这本身就是一种垂直 Agent 在百花齐放的体现。
但最终,这些垂直能力又都会被通用 Agent 吸收掉。
🧑🏻💻 择因
我和阿岛一样,工作中的通用 Agent 就是 Coding。但我也观察到一些有趣的垂直应用,比如视频剪辑领域。
让一个为 Coding 而优化的通用 Agent 去做视频剪辑和理解,实践范式完全不同。虽然最近也有一些用代码生成动画的例子,但用一个专门的垂直 Agent 去生产漫剧、短剧,效率和效果肯定远超通用 Agent。
👨🏻💻 阿岛
我持不同观点。我觉得这只是因为现在的视频理解和生成模型还不够强。多模态领域正在飞速进步,最终通用 Agent 也能做好这些事,那只是一个交互问题。
👦🏻 Koji
那有没有哪些垂直领域,是通用 Agent 的"最后一公里"真的很难走完的?
👨🏻💻 阿岛
比如法律。这是一个非常严肃的领域,你最终要给客户出具正式的法律意见,需要考虑合规成本和风险,绝对不能出错,而且很多问题没有标准答案。
模型可以提供几个建议,但最终拍板承担责任的那一步,比如决定在海外遵循哪个国家的合规路径,还得靠人。
Agent Infra 的创业机会
👦🏻 Koji
OpenClaw 的热潮也带来了很多关于创业机会的讨论。有人认为做垂直 ToB 的 Agent 是机会,也有人认为 Agent Infra 层是机会。你们怎么看 Agent Infra 层的创业机会?尤其在 Anthropic 发布了 Managed Agents 之后。
👨🏻💻 阿岛
我说一下 Agent Infra。我认为它有几个层次。最核心的两个问题是:identity(身份认证)和 payment(支付)。这两块我不认为创业公司能搞定。
👦🏻 Koji
身份和支付,创业公司做不了?
👨🏻💻 阿岛
对。你想想移动互联网,最终解决这两个问题的是谁?是微信和支付宝,PC 时代就存在的巨头。因为它最终会成为社会级的基础设施,创业公司无论从责任、资源还是说服力上,都难以承担。
👦🏻 Koji
需要巨大的信任背书和极高的稳定性。
👨🏻💻 阿岛
对。但再往上一层,比如为 Agent 构建面向特定场景的工具(tool)和环境(environment),是有机会的。比如,在身份问题解决后,你做一个 CLI,能让 Agent 方便地挂号,这算不算 Infra?我觉得算。或者让 Agent 能方便地缴费、打车。
这一层更偏业务和应用,机会取决于你在那个领域的积累。
👦🏻 Koji
就是说你得在那个垂直领域有足够的 Know-How?
👨🏻💻 阿岛
对。所以我认为这一层会发生两个阶段的演进。
第一阶段,是该领域的现有玩家,如滴滴、美团,主动融入 Agent 生态。
第二阶段,当 Agent 已经能接入各种环境和能力之后,会出现基于 AI 的新产品范式创新机会。
但在第一阶段,基础设施还没搭建好的时候,一个创业公司想自己打穿所有环节,太难了。
Opus 4.7
👦🏻 Koji
最近行业新闻不断,比如大家都在关注的 Opus 4.7,你们怎么看?
👨🏻💻 阿岛
从模型视角看,4.5 是一个强 SFT 模型,RL 做得不多。从 4.6 开始,能明显看到它在加强 RL。到了 4.7,是一个非常强的 RL 模型,包括那个 xhigh 档位。
RL 的问题在于它只关心最终的 reward,对过程中的幻觉等问题缺乏有效控制,所以很容易出问题。很多人吐槽 4.7 的实际体验还不如 4.6,这是 RL 的典型问题。
但抛开这些不谈,从 Benchmark 来看,它进步巨大。我也认同 Hugging Face CEO 的观点,它很可能蒸馏了 Mythos,换我我也会这么做。
Claude Code 实名制
👦🏻 Koji
Claude Code 最近要求用户实名,你们怎么看?
🧑🏻💻 择因
这暴露了 AI 时代的一个核心问题:**一个 Agent 发出请求很容易,但如何自证身份很难。**从这个角度看,做人脸识别等验证有其逻辑。
这背后是如何对 AI 的行为进行归因的难题:它的行为到底属于哪个个体,还是某个组织?在规则明确之前,我能理解他们往这个方向尝试。
这也暴露了一个巨大的机会:如何建立一套 AI 时代的身份证明系统。

👨🏻💻 阿岛
择因的假设比较善意,我没那么善意。在我看来,这套逻辑很简单,并且在他那里是自洽的:AGI 很强大,所以必须被约束,以防危害人类。为了 safety ,必须确保 AI 不被"邪恶"的国家或个人使用。
但我觉得,这个定义的 ego 是不是太大了?凭什么由你来定义谁是"邪恶"的?总之,我非常不认同。我们的观点是 intelligence with everyone,而不是扫了人脸的才能用。
为什么 Anthropic 不发布 Mythos?
👦🏻 Koji
前段时间 Anthropic 说自己的 Mythos 模型可能对人类造成威胁,因此不公开发布。你们怎么看这件事?
👨🏻💻 阿岛
如果顺着他 safety 的逻辑,这当然是一个负责任的做法。我相信他们确实做到了那个能力,先保证人类的各种基础设施不要被攻破,这是正确的。但我不确定,这是不是他唯一的理由。
🧑🏻💻 择因
结合 Anthropic 最近发布的 Claude Managed Agent 架构来看,它把 AI 的"大脑"和"手"完全分开了。所有思考都在云端,用户只能通过一个受限的环境看到它的执行动作。
这是否意味着,他们不想把模型深层次的思考过程暴露给用户,想做那个"知道一切"的黑盒?
另一个现实问题是算力。当你发布了一个极其强大的模型,却因为算力不足而无法让大家广泛使用,这是很尴尬的。
他们内部肯定算过一笔账:在当前时间点,把如此消耗算力的模型开放推理,到底划不划算。
👨🏻💻 阿岛
我觉得不是这样。它的本质就是封闭,他希望垄断这一点。
🧑🏻💻 择因
一个乐观,一个悲观的解读吧。
👦🏻 Koji
所以你觉得他没想那么复杂,就是一个垄断的商业考量?
👨🏻💻 阿岛
不,安全的考量肯定有,而且是对的。但我觉得不只这一点。
Claude Code 源代码泄露的影响
👦🏻 Koji
Claude Code 源代码泄露对行业有什么影响?
🧑🏻💻 择因
作为 Agent 研发工程师,看到一个备受赞誉的 Agent 源码,第一反应是兴奋,可以学习最佳实践。但深入去看,也缓解了我的 FOMO。你会发现他们内部有很多实验性功能,比如 Agent 做梦、养宠物、更激进的多 Agent 协作等,都还没开放给用户。
这证明了,即便是拥有最强智能和无限算力的公司,在通用 Agent 这条路上,也依然处在探索和实验阶段。
这反而给了我们信心:
在这个时代,只要你有能力快速验证自己的想法并落地,就有机会赶超。
👦🏻 Koji
看到源码发现,里面没有那么多魔法,也是大量的假设和摸索?
🧑🏻💻 择因
是的,尤其是和 OpenAI 开源的 Codex 比较。Codex 极度简化,把一切都交给模型。而 Claude Code 刚好相反,它处处设防,约束模型,像是 Anthropic 自己都不信任自己的模型,像个中国式家长。
这两种不同的理念,让我们看到,原来世界上最聪明的人和我们一样,在为同一个问题焦虑,大家的思考还在同一个大气层内。
👦🏻 Koji
他们源码里那些还在灰度的功能,可能和我们正在想的也差不多?
👨🏻💻 阿岛
对,都差不多。比如他们发 Co-work 的时候,我们提前三周也开始做了,大概 3.5 个工程师,比他们晚一周发出来。这种"撞车"的经历很多。
所以,看到 Claude Code 的代码,里面有很多优秀实践,但没有太超出我的认知。甚至我看到了很多我刚才说的"龙虾化"的影子。
Claude Code 最核心的一点还是自进化,它可能是最早的自进化 Agent 之一。
👦🏻 Koji
它的自进化体现在哪?
👨🏻💻 阿岛
我相信,他们一定在用 Claude Code 开发 Claude Code 自己。用 Claude 模型加上 Claude Agent,来开发自己的模型和 Agent。这就是自进化。
Manus 这一年
👦🏻 Koji
说到 Agent,不能不提一年前发布的 Manus。当时也是现象级产品,现在虽然被看作"初代",但它一直在进步,而且很好用。你们怎么看这一年 Agent 的进步?
👨🏻💻 阿岛
我用 Manus 用得不多。我的观点是,Agent 或 Harness 这层产品,是有生命周期的,它会随着模型的进步而不断更新换代。
我相信 Manus 的团队如果还在持续创业,他们应该会去做新的产品了。一代版本一代神,版本变了,神肯定也变了。

🧑🏻💻 择因
Manus 去年确实是现象级产品,它把用户对 Agent 的审美拉到了一个很高的水平。 后来我持续关注它的迭代,发现他们在一个路径上做了非常精细的打磨,就是"用 Agent 交付生产资料"。
但它和今年火起来的 Agent 有一个核心区别。今年的 Open Claw 和 Hermes Agent 都是让用户自己买订阅、付 Token 费。用户能清晰地感知到自己花了多少钱,并且没有中间商赚差价。
你可以用更便宜的价格买到 Token,然后把自己的 Agent 玩得很好。这和 Manus 这种整合厂商的商业模式完全不同。
我并不认为 Manus 的模式落后了。它其实在帮你省钱,用更优化的方式消耗 Token,交付更高质量的结果。而本地 Agent 则是一个"花钱"的逻辑,你会有一种野心,想用最好的模型,花更多的钱让它变得更好。
这两套逻辑会并存,满足不同用户的需求。有人只想多快好省地交付结果,有人则想完全拥抱 AI,把自己变成科幻电影里的人物。
👨🏻💻 阿岛
我的观点不同,我觉得最后都会被统一掉。这只是因为今天的模型还不够强。
👦🏻 Koji
畅想一下,统一之后的产品形态会是怎样?
👨🏻💻 阿岛
很难具体描述。但我们的目标是,它支持全模态的输入和输出,交互近实时,且极其简洁。承载它的硬件形态也会发生巨变。
大概率会是这样:你用最自然的方式与它交互,比如扔一段视频给它说"找一部类似的电影"。不需要任何 prompt engineering。你让它办事,它直接交付结果。
多数时候你无需关心过程,但想看也能看。围绕它,会形成一整个生态。
大家可以回想一下这个演进过程:从 Copilot 到 Cursor 再到 Claude Code,再到今天我用 OpenClaw 指挥几个 Claude Code。
我们到底在经历什么?就是外面的那层壳,在变得越来越薄。
👦🏻 Koji
Cursor 最近的新版本也长得越来越像 Claude Code 了。大家的产品似乎在趋同?
👨🏻💻 阿岛
这只是这个版本的"神",是有生命周期的。
去年 Manus 出来,定义了过去一年的交互范式:让你看到执行过程,因为那时模型能力还不够强,大家不那么信任模型。
下半年模型变强了,大家足够信任它,就不再关心过程,只要结果。你看 Claude Code 的极简模式,就像 OpenClaw 一样,最终只给你一个结果。这只是这个版本的答案,下一代会是什么,I don't know。
B 站创作者与 AI 的火花
👦🏻 Koji
我们今天在 B 站直播,大家也都是 B 站用户。最近在 B 站上有看到什么印象深刻的 AI 内容吗?我自己对花叔那个"蒸馏"名人的女娲 skill 印象很深。
🧑🏻💻 择因
过去 B 站是学习的地方,现在有了 AI,很多人从学习转向了创造和分享。
我看到一个 up 主(抱歉忘了名字),他用 OpenClaw 连接了他家的机器狗。这很新奇,因为它打破了我们传统认知里只能通过文本与 Agent 交互的模式。当 Agent 有了视觉反馈,输入频率变得极高,这其中能擦出什么样的火花?这给了我很大的想象空间。
另一个是个人爱好。有一类叫文字冒险游戏,比如《Fate》,本质是视觉化的小说。现在有 up 主做了一个网站,把这类游戏里海量的文本和人物立绘导进去,让这些鲜活的角色可以在一个场景里自由对话。
你甚至可以扮演其中一个角色,和你喜欢的虚拟人物交流。它把一个原本有限的故事,变成了一个可以无限延续下去的世界。
这个视频播放量不高,但让我印象非常深刻。
👦🏻 Koji
我最近也看到任天堂刚发的新游戏《Tomodachi Life》,我觉得它可能是 AI 游戏找到的一种 PMF。你可以在一个岛上创造很多虚拟小人,让他们共同生活,然后你像导演兼观众一样,围观他们上演的各种 drama。这是一个由玩家部分主导、但又能无限生成内容的模拟世界。

👨🏻💻 阿岛
这是我对世界的认知之一:
外星人在看着我们玩。量子力学似乎也在暗示,这个世界可能真的是模拟的。
👦🏻 Koji
哈哈,其实我也时常这么想。
看到那个游戏时,感觉就是一层套一层的模拟。
👨🏻💻 阿岛
对,但 whatever,只要我们开心就好。
👦🏻 Koji
过好每一天,开心就好。
打破共识,在 AI 时代保持乐观
👦🏻 Koji
直播最后,我们聊一个宏大点的问题。关于 Agent,有没有什么是今天大多数人认可,但你们不认可的"共识"?
👨🏻💻 阿岛
有一个。从春节以来,裁员的消息不断,很多人认为"人会被 AI 替代,会无事可做"。我非常不认同这一点。
我认为,人类的创造力无可替代。
AI 是水、是电、是蒸汽机,但最终驾驭它、创造出美好事物的,还是人类。所以不用担心被替代。过去每一次技术革命,都有岗位消失,但人类也因此从事了体力上更轻松、对健康更有益的工作,平均寿命也得到了提升。这是我的信仰。
👦🏻 Koji
就像《人性中的善良天使》那本书里说的,人类总习惯悲观,但数据证明世界在持续变好。
👨🏻💻 阿岛
Ray Dalio 在《原则:应对变化中的世界秩序》里画过一条 GDP 的指数增长曲线,即便经历了两次世界大战,在长周期里也只是微不足道的停顿。

虽然历史的一粒沙,落在个人身上是一座山,但我相信这条曲线的宏观趋势。
我还相信另一条曲线,它决定了我为什么加入这个行业——摩尔定律。
你获得的智能在指数级提升,而单位智能的成本在指数级下降。
这是我信奉的两个规律。
🧑🏻💻 择因
我从面试的角度补充。很多年轻工程师会向我表达被替代的焦虑。我想讲一个例子。
上个世纪,ATM 机出现时,银行从业者也非常恐慌,觉得自己的"金饭碗"要没了。但事实是,ATM 机提高了效率,让银行得以开设更多网点。最终,银行的数量变多了,从业者也变多了。
这种由技术提效带来岗位转型的范式,在 Agent 时代一定会反复重演。所以,不要担心被替代。
如果你有这个想法,你就已经输了。
一定要尽早拥抱 AI,把它当作伙伴、工具,甚至是挚友。
👨🏻💻 阿岛
我补充一点。虽然我相信人不会被替代,但我当初加入这个行业还有一个原因。
当时我正在 gap year,用 ChatGPT 帮我写代码,那时它的能力还没那么强,但我已经意识到了一点:打不过就加入。
👦🏻 Koji
打不过就加入?
👨🏻💻 阿岛
是的,你必须拥抱 AI。就像有了电力和蒸汽机,你却选择不用,那就是用冷兵器对抗热兵器,肯定会被淘汰。
新版本来了,你必须去学习新版本的玩法。
👦🏻 Koji
以积极乐观的心态拥抱新版本,相信它不是淹没我们的滔天巨浪,而是能让我们自由翱翔的新舞台。
没想到是以如此乐观的基调收尾。
谢谢二位,非常开心今天能在 B 站完成这场直播。
👨🏻💻 阿岛
谢谢 Koji,谢谢 B 站的朋友们。
🧑🏻💻 择因
谢谢大家。

十字路口正在寻找独立撰稿人,撰写 AI 产品和模型评测。
如果你写过类似文章:实测 PixVerse C1、实测 LibTV,请联系 zeo0811@gmail.com ,邮件内容请包括:① 个人介绍、② 你写过的 AI 评测文章。
我们会提供有竞争力的稿酬。期待与你一起观察与记录 AI 时代 🎪