Cerebras 百亿 IPO 背后:AI 算力的转折时刻

一场关于 AI 算力未来的押注

一场关于 AI 算力未来的押注

👧🏻 作者: Shirley Wu

🥷 编辑: Koji

🧑‍🎨 排版: NCon

2026 年 5 月 14 日,Cerebras Systems 在纳斯达克挂牌交易。

最终 IPO 定价为每股 185 美元,招股价区间从最初 115-125 美元一路抬升至 150-160 美元,又在路演最后阶段再度上调;发行规模也从 2800 万股扩大到 3000 万股。一次 IPO 就募集了 55 亿美元。

更戏剧性的是开盘瞬间,股价直接跳升至 385 美元,较发行价上涨 108%,这是自 2019 年 Uber 上市以来美国规模最大的科技公司 IPO。

史上最热的芯片 IPO 现场

据 TechCrunch 报道,盘中股价回落至 330 美元附近、收盘报 311 美元,对应市值约 660 亿美元;按盘后交易价格估算,估值进一步上探至千亿美元区间。

而仅在一年之前,这一切还看起来遥遥无期。

Cerebras 早在 2024 年就提交过招股说明书,但因阿布扎比主权基金 G42 的持股触发了美国外资投资委员会(CFIUS)的长期审查,加之营收高度集中于 G42 一个客户,IPO 计划当时被搁置。

直到 2026 年 4 月,公司公布 2025 年营收 5.1 亿美元,同比增长 76%,并在前一年亏损近 5 亿美元的情况下扭亏为盈,净利润达 2.378 亿美元,市场情绪才被重新点燃。

如果要给这一刻找一个最清晰的注脚,或许是在 AI 算力被普遍认为"只能等于 Nvidia"的一年之后,市场用真金白银开出了一个不一样的答案。

就在 IPO 三天之前,Ben Thompson 写下了一份反向预言

颇有戏剧性的是,Stratechery 的 Ben Thompson 在 IPO 前几天发布了一期题为《The Inference Shift》的播客与同名长文。

文章没有评论 Cerebras 的估值,但提供了一个让我们重新审视这次 IPO 的结构性框架。

Ben 把 LLM 时代的推理工作负载切分成了两类,认为它们将走向截然不同的硬件归宿:

答案推理(Answer Inference)

本质特征是"有人在等"。无论是 ChatGPT 的对话、Claude Code 里的代码补全,还是未来 AI 可穿戴设备的语音交互,只要响应方需要被人类感知,token 的生成速度就是核心约束。这是 GPU 的 HBM、Cerebras 的 SRAM 以及 Groq 的 LPU 等共同竞逐的战场。

智能体推理(Agentic Inference)

本质特征是"没人在等"。当一个 Agent 架构整夜在跑一个长任务、当机器把任务派发给另一台机器去完成,"用户体验"这个词不再适用。Ben 指出,这种工作负载真正稀缺的不是带宽和速度,而是内存容量,即上下文、状态、历史、嵌入向量、对象存储里的中间产物,全部都需要被"记住",但完全不需要"很快地被记住"。

由此 Ben 给出了一个非常关键的判断:如果延迟不再是约束,那么"为延迟付溢价"的整套架构假设就会松动。智能体推理更看重的是更便宜的 DRAM、更慷慨的容量、够用的算力,而不是顶级 HBM 与最快的 NVLink。

在这种新的工作负载下,GPU 会被解绑,CPU 的工具使用速度甚至比 GPU 的 token 速度更值得关心。

Ben 的最终结论是:训练市场仍由 Nvidia 主导;答案推理是一个"有意义但相对小众"的市场,Cerebras 与 Groq 等 SRAM 机器在此具备结构性优势;而智能体推理将是规模最大的市场,因为它不再受人类时间约束、只受计算机运行时间约束。

Jensen Huang 多年来反复说"摩尔定律已死",他的意思是性能进步要靠系统创新;但 Ben 给出了一个更尖锐的版本:

当 Agent 真正能在没有人类介入的情况下持续工作时,摩尔定律已经无所谓,因为我们手里已经有的算力本就够用。

把这个框架放回 IPO 当天的纳斯达克,会得到一个让人不安的小问题:市场为 Cerebras 开出了 660 亿至 1000 亿美元的估值,但它定价定的是答案推理这条赛道。

如果 Ben 是对的,这意味着市场押注的并不是未来算力的大盘。

创始人怎么讲故事,与 SemiAnalysis 的分析报告

Cerebras CEO Andrew Feldman 当然清楚在 IPO 前必须解决哪几个心理障碍,当被问到"为了说服投资者,在这次路演期间做的最重要的三件事是什么"时,他的回答可以归纳为以下三个核心论点:

需求侧无限大、供给侧路径多元、CUDA 护城河被高估

而这三个论点共同构成了 Cerebras 上市的标准叙事。

但如果把视角换成 SemiAnalysis 在 IPO 前夕发布的《Cerebras — Faster Tokens Please》这份长文(全文相当于他们 4 篇普通文章的体量,我们截取部分),上述叙事的成色就会被技术与商业现实反复压力测试。下面三个层面尤其关键:

技术层面:Cerebras 的能力边界已经被当下的 agentic 工作负载触及

SemiAnalysis 同时确认了 Cerebras 的两个事实:一方面 WSE-3 整片晶圆有 44GB SRAM、提供 21 PB/s 的内存带宽,比英伟达 H100 的 HBM 带宽高出约 6000 倍,这是它在"快"这件事上的全部底气;

另一方面 WSE-3 晶圆与晶圆之间通信的带宽仅 150 GB/s,这大约只有英伟达 GPU 之间互联通道(NVLink 5)的六分之一。

这个带宽限制带来的直接后果是:Cerebras 服务大模型时被迫只能走 Pipeline 并行(pipeline parallelism)。

你可以把它想象成一条工厂流水线:每一片晶圆只负责模型的某几层,做完后把"半成品"(激活值)传给下一片晶圆,整条流水线协作完成一次推理。

这种方式只在相邻晶圆之间传递少量中间结果,而不需要在晶圆之间搬运庞大的模型权重。

这个方案在小模型上行得通,在大模型上就开始难看:

  • Cerebras 公有云目前能提供的最大正式(Production)模型只到 GPT-OSS(120B 参数);最大预览(Preview)模型也只到 GLM 4.7(355B)。

  • Llama 3.1 405B、Qwen 3 Coder 480B、Llama 4 Maverick、Llama 3.3 70B 等曾经上线过的大模型现已被全部下架(Deprecated)。SemiAnalysis 推测是服务这些模型的单位成本撑不住。

  • 而 DeepSeek V3 和 Kimi K2 这两个被市场广泛使用的开源前沿模型,从未在 Cerebras 的公开端点上线过。

  • 公有端点的最大上下文窗口被钉在 128K。

更关键的是 SemiAnalysis 自己抓取的生产侧数据。

他们通过一个匿名代理收集了来自 Claude Code、Codex、Cursor、OpenCode 等智能体编程工具的真实请求,样本规模约 43.2 万条请求、约 800 亿 token。

结论是:"典型的 P50 输入序列长度(ISL)约为 96.3K token,并非 64K 或更少……我们的请求中近 50% 超过 128K,而 128K 正是 Cerebras 当前公开端点所支持的最大上下文窗口。"

从图中可以清楚看到,128K 这条线正好落在 P50 与 P75 之间,而 Cerebras 公有端点目前支持的最大上下文窗口恰好是 128K。

换句话说,**今天 agentic 编程市场的中位请求已经逼近 Cerebras 的硬上限,近一半请求直接超出它的服务能力。**更值得注意的是右侧的长尾:P90 接近 50 万 token,P95 超过 67 万,这是 Agent 工具在大量加载 skills、system prompts、tool use context 之后自然产生的真实工作负载形态,而非边缘异常值。

让我们把这张图重新带回 Ben Thompson 的分析框架,他判断智能体推理(Agentic Inference)真正稀缺的是内存容量而非速度,这张分布图正是这个判断在生产数据上的具体对照 —— Cerebras 在 agentic 赛道上面对的不是"跑得不够快",而是结构性"装不下"

当前 WSE-3 晶圆架构面临的难题,不仅是 SRAM 容量被晶圆面积锁死,更是片外带宽限制了多片协同时的内存池化能力。

雪上加霜的是 SRAM 工艺红利已近枯竭:WSE-1 在 16nm 上有 18GB SRAM,WSE-2 在 7nm 上跃升至 40GB,但 WSE-3 在 5nm 上只到 44GB(仅 +10%)。

SemiAnalysis 同时指出,N3E 及以后的工艺节点 SRAM 几乎不再缩小(见下图),下一代 CS-4 系统如果沿用同款 WSE-3 硅片,得靠提高功耗换取更高时钟频率。

换句话说,Cerebras 在容量这条战线上没有便宜的下一步。

商业层面:OpenAI 的三重绑定既是估值核心支撑,也是脆弱点

OpenAI 在 Cerebras 的未来中扮演着举足轻重的角色。SemiAnalysis 详细披露了 Cerebras 与 OpenAI 在 2025 年 12 月签订的主合作协议:

采购承诺

OpenAI 承诺在 2026–2028 年分批采购 750 兆瓦 AI 推理算力,每批合约期 3–4 年,可延长至 5 年;并持有额外采购 1.25 吉瓦的选择权,届时总规模将扩展至 2 吉瓦。

剩余履约义务

截至 2025 年 12 月 31 日,Cerebras 招股书披露的未履约金额为 246 亿美元,几乎全部来自 OpenAI 一家。

营运资金贷款

OpenAI 同时向 Cerebras 提供了一笔 10 亿美元、年利率 6% 的营运资金贷款;如果 Cerebras 通过算力或硬件交付来偿还,则利息全免;若合作协议因非 OpenAI 重大违约的原因被终止,Cerebras 可能被要求立即偿还本息。

认股权证

Cerebras 向 OpenAI 发行了 33,445,026 股 N 类(无投票权)普通股的认股权证,完全稀释后 OpenAI 可能持有 Cerebras 约 12% 的股份。

将这三件事叠在一起看,可以发现 OpenAI 既是 Cerebras 的最大客户,也是最大债权人、最大单一股东之一。

Cerebras 在 2025 年 5.1 亿美元的营收中,相对于客户兼股东兼债权人为锁定供给所做的战略性采购,有多大比例真正来自独立的、可持续的市场需求,这个问题在招股书上还暂时看不出答案。

模型层面:让 Cerebras 一战成名的 GPT-5.3-Codex-Spark 实际是蒸馏小模型

最后 SemiAnalysis 还不忘提醒读者。

OpenAI 在 2026 年 2 月发布的 GPT-5.3-Codex-Spark 在 Cerebras 上跑出了每个用户每秒可处理高达 2000 个 token 的惊人速度,但这并不是真正的 GPT-5.3-Codex,而是基于 gpt-oss-120B 架构、从 GPT-5.3-codex 模型蒸馏而来的一个比原模型小 10 倍以上的版本。

在今天,让 Cerebras 跑得起来的只是这种轻量化、专门化的模型;而真正承载 OpenAI 主营收的是参数规模在 1 万亿以上的前沿模型,要把这一量级的模型塞进 Cerebras 架构,可能需要付出可观的成本与延迟代价。

一场被忽视的叙事错位

把 Ben Thompson 的框架与 SemiAnalysis 的分析报告并置在 IPO 当天,会清楚看到三层错位:

第一层:叙事与未来的错位

市场为 Cerebras 开出 660 亿至 1000 亿美元的估值,定价的是 fast tokens 这条赛道未来的可扩张性。

但按 Ben 的判断,AI 算力未来真正的大盘是 agentic inference,而 agentic inference 的核心需求是大容量内存层级与够用的算力,不是带宽与速度。Cerebras 押注的恰好处在这股长期趋势的反面。

第二层:叙事与生产的错位

SemiAnalysis 自己的 agentic 编程请求样本显示,主流 agentic 工作负载的上下文长度已经触达甚至超过 Cerebras 公有端点的 128K 上限。

今天还在为"快"付费的最大客户是有人类等待的代码生成场景;可一旦 Agent 真正脱离人类回路独立运行,对速度的偏好就开始让位于对容量与状态保留的偏好。这正在发生,而非未来时。

第三层:叙事与客户结构的错位

Cerebras 招股书上写着 246 亿美元的在手订单(即"剩余履约义务"),但当客户、债权人、股东叠在同一个对手方身上时,这个数字的会计含义和经济含义并不等价。

OpenAI 之所以愿意一次性锁定 750 兆瓦容量,部分理由确实是看到了 fast tokens 的市场需求;但更现实的理由也许只是:作为一家正在四处锁定算力供给的公司,把 Cerebras 这种相对小众但具备差异化能力的供应商纳入自家算力组合,是一种合理的对冲行为。

这并不直接证伪 Cerebras 的长期价值,但确实意味着,这 246 亿衡量的更多是 OpenAI 的算力策略广度,而不是 Cerebras 的独立商业实力。

但不得不承认,Cerebras 是过去十年硬件领域最大胆、也最成立的工程赌注之一。能把一整片 300mm 晶圆做成单一可寻址芯片,并解决良品率、功率传输、25kW 散热等一系列问题,这本身就是一项了不起的工程成就。

其次,fast tokens 这条赛道是真实存在的市场。

SemiAnalysis 自己披露其 80% 的 AI 预算(峰值年化 1000 万美元)花在了 Opus 4.6 Fast 模型上,这是以 6 倍价格换取 2.5 倍速度。

Nvidia 在 2025 年 12 月以"许可式收购"方式吸纳 Groq,进一步证明 SRAM 机器的市场不是想象出来的。Cerebras 在这个赛道里是真正的赢家。

此外,CEO Andrew Feldman 关于"CUDA 锁定被高估"的判断,从 Gemini 3 在 TPU、Anthropic 在 Trainium 的实践来看,确实在被现实佐证。

Cerebras 的存在本身就在拓宽产业的供给曲线,这对整个行业来说都是好事。

因此,我们不下"高估"或"泡沫"这种结论性判断。我们想说的是:

这次 IPO 的市场定价,大概率没有 price in 智能体推理对算力架构的根本性重构,也没有充分 price in 客户高度集中带来的不对称风险。

市场总是先听见声音,再看清结构。IPO 当天的喧嚣属于 fast tokens,但真正决定 Cerebras 长期命运的,是它在 agentic inference 这场更大变迁中的位置。

Ben Thompson 这篇文章不会改变 IPO 当天的市场结果,但它会成为我们一年之后回望这一切时,或许最有价值的那一个对照坐标。

十字路口正在寻找独立撰稿人,撰写 AI 产品和模型评测。 如果你写过类似文章:《实测 PixVerse C1》、《实测 LibTV》,请联系 zeo0811@gmail.com ,邮件内容请包括:① 个人介绍、② 你写过的 AI 评测文章。我们会提供有竞争力的稿酬。期待与你一起观察与记录 AI 时代 🎪

参考资料

[1] https://stratechery.com/2026/the-inference-shift/

[2] https://open.substack.com/pub/semianalysis/p/cerebras-faster-tokens-please?r=7dnfkb&utm_campaign=post-expanded-share&utm_medium=post%20viewer

[3] https://techcrunch.com/2026/05/14/cerebras-raises-5-5b-kicking-off-2026s-ipo-season-with-a-bang/