50 亿背后:AI 基建的新一轮洗牌|Vital Views

参赞生命力

在全球 AI 技术持续演化的进程中,半导体、尤其是 AI 芯片,是这场深层重构的一个关键杠杆。它们支撑着新一代智能系统的基础架构,也影响着整个科技链条的协作方式与创新速度。

最近,英伟达对英特尔的一笔 50 亿美元投资,表面看是一次跨越竞争旧叙事的资本合作,实际更像是对 AI 基础设施建设的一次前置布局,开启了全球范围内,新一轮系统级的重构——从硬件封装,到云服务架构,再到数据中心部署逻辑,都正在悄然生变。

我们选择转载这篇编译的文章,希望和你一起捕捉这些表层线索下的信号:当 AI 不再只是 "技术" 的演进,而成为整套科技范式的迁移,我们能从哪些角度来看清当下变化的节奏,捕捉新的趋势与可能性?

Enjoy

在 a16z (Andreessen Horowitz)最新一期的视频播客访谈中,SemiAnalysis 首席分析师迪伦·帕特尔(Dylan Patel),a16z 合伙人莎拉·王(Sarah Wang),以及 a16z 合伙人、英特尔数据中心和人工智能业务部,前首席技术官吉多·阿彭策勒(Guido Appenzeller),共同探讨了这场交易的意义、英伟达的护城河、华为的崛起,以及 AI 基础设施的未来走向等议题,揭示了一个由技术创新、地缘政治和万亿级资本共同驱动的全新时代。

对谈核心观点

  • 英伟达投资英特尔重塑格局: 此举是英伟达的一步妙棋,不仅可能带来丰厚回报,也对 AMD 和 ARM 等竞争对手构成了巨大压力,重塑了 PC 和数据中心市场的竞争态势。

  • 华为是英伟达最强劲的对手: 尽管面临美国制裁,华为在 AI 芯片设计和制造方面正迅速追赶,其强大的执行力和国内市场支持使其成为英伟达在全球范围内(尤其是在非美国市场)不容忽视的竞争者。

  • AI 算力需求驱动万亿级市场: 超大规模数据中心的建设正在以前所未有的速度进行,甲骨文凭借其灵活的策略和庞大的资本,成功抓住 OpenAI 等大客户,成为 AI 云市场的主要赢家。

  • 英伟达的成功源于高风险赌注: 黄仁勋以其非凡的直觉和敢于押上整个公司的魄力,带领英伟达多次抓住市场顺风,建立了强大的技术和市场护城河。

  • 新硬件带来新挑战: 虽然 GB200 等新一代 GPU 在性能上实现了巨大飞跃,但其高昂的总拥有成本、复杂的部署要求和可靠性问题,为使用者带来了新的基础设施挑战。

当长期的竞争对手握手言和,市场总会嗅到不同寻常的气息。英伟达向英特尔投资 50 亿美元的消息一经公布,便引发了业界的广泛关注。帕特尔指出,这笔投资对英伟达而言是一笔妙棋,甚至在消息公布后,英特尔的股价就上涨了 30%,为英伟达带来了可观的潜在回报。

更深层次的意义在于,此次合作不仅涉及财务投资,更涵盖了定制数据中心和 PC 产品的共同开发,这被帕特尔形容为一切都回到了原点,英特尔有点像在向英伟达卑躬屈膝。他回顾了英特尔和英伟达之间曾经围绕芯片组反竞争行为的诉讼纠葛,如今英特尔将制造小芯片与英伟达的 GPU 进行封装,共同打造 PC 产品,这无疑是市场格局的一次颠覆。帕特尔认为,这种深度整合的 X86 笔记本电脑,可能会成为 "市场上最好的产品"。

前英特尔高管吉多·阿彭策勒对此表示:"如果你的两个最大的死敌突然联手,那是你能得到的最糟糕的消息。" 他认为,这项合作对短期的客户和消费者是利好,尤其在笔记本电脑市场。然而,其对竞争对手的冲击是巨大的。阿彭策勒直言不讳地指出,AMD 和 ARM 都将面临严峻挑战。AMD 的显卡虽然不错,但软件生态系统孱弱,而英伟达与英特尔的联手将进一步挤压其生存空间。对于 ARM 而言,其核心卖点是与英特尔的 "不合作",但现在英伟达可能借此进入英特尔的技术领域,成为更危险的 CPU 竞争者。 阿彭策勒总结道:"我没料到会这样重新洗牌了,我认为这是一个了不起的发展。"

在全球芯片竞争的另一端,尽管面临严酷的美国制裁,华为的 AI 芯片业务正在逆势崛起,成为英伟达在全球市场(尤其是在美国市场之外)最不容忽视的竞争对手。帕特尔回顾了华为在 2020 年发布昇腾(Ascend)芯片时的辉煌,当时他们是首家推出 7 纳米 AI 芯片的公司,其技术水平与英伟达的差距几乎不存在。

然而,制裁使华为失去了台积电的代工能力,被迫转向国内中芯国际(SMIC)寻求生产,同时还通过各种渠道获取海外的内存供应。帕特尔透露,华为通过复杂的实体网络,曾从台积电获得了近 300 万片芯片订单,总价值约 5 亿美元。尽管这些渠道最终被切断,但华为的韧性不容小觑。

随着 2025 年 H20 等英伟达专供中国市场的 AI 芯片被禁,中国政府正在积极推动国产替代。帕特尔指出,华为等中国公司在逻辑芯片(替代台积电)和内存芯片(替代海力士、三星)方面正迅速追赶。他认为,虽然仍有差距,但中国能够制造大量的 7 纳米人工智能芯片,甚至可能通过使用现有设备来制造 5 纳米芯片。

更令人惊讶的是,华为在内存领域也取得了突破,宣布将采用定制 HBM(高带宽内存)。帕特尔认为这证明了华为正在迅速赶上英伟达和 AMD 在内存技术方面的计划。尽管产能和良率仍然是关键瓶颈,但帕特尔强调:"问题总在于,我们能制造出来吗?黄仁勋会说的是,你是在赌中国无法制造吗?这只是时间问题,而不是会不会的问题。"

在半导体行业激荡的背景下,AI 算力需求的爆炸式增长正在推动一个史无前例的万亿级市场。 帕特尔指出,银行界对明年所有超大规模企业(微软、CoreWeave、亚马逊、谷歌、甲骨文、Meta)的总资本支出预测约为 3600 亿美元,而他的研究模型显示,这一数字更接近 4500 亿到 5000 亿美元,并且其中绝大多数将流向英伟达。

在这场算力竞赛中,甲骨文(Oracle)凭借其独特的策略脱颖而出。

帕特尔认为,甲骨文与 OpenAI 签署的超过 3000 亿美元的合作协议,是股票和上市公司历史上 "最前所未有的事情"。他解释了甲骨文成功的秘诀:拥有业内最大的资产负债表,且不固守任何特定硬件或网络技术,这使其在评估和抢购数据中心容量方面极具灵活性。

帕特尔通过追踪全球每一个数据中心的建设进度、电力供应、芯片部署以及客户协议,精确预测了甲骨文的营收增长。他发现,甲骨文正在积极签约和部署大量新数据中心,这些设施将在未来几年内为 OpenAI 和字节跳动等大客户提供关键的 AI 算力支持。

相比之下,亚马逊 AWS 曾一度在 AI 云领域陷入 "危机"。帕特尔在 2023 年第一季度撰文指出,AWS 过去在横向扩展计算方面的优势,在垂直扩展的 AI 基础设施时代变得滞后,其内部 AI 芯片团队专注于成本优化而非性能最大化。尽管 AWS 收入增长一度放缓,但帕特尔预测其将重新加速,因为亚马逊仍拥有最大的闲置数据中心容量,这将在未来一年内转化为 AI 收入。

然而,新一代 AI 硬件的部署也带来了挑战。尽管亚马逊在液冷等高密度数据中心技术上经验丰富,但吉多·阿彭策勒提出了一个关键问题:"现在我可能真的需要旁边有一条大河来冷却了。在很多地区,我就是没法获得足够的水资源。而且,很可能在同一地区,电力也成了问题。" 帕特尔承认存在效率问题,但强调亚马逊正迅速投入并转化这些容量。

对于微软与 OpenAI 的关系演变,帕特尔指出,虽然微软曾是 OpenAI 的独家计算供应商,但随着 OpenAI 寻求多元化,并与甲骨文达成巨额协议,这种关系正在被重塑。这背后的核心驱动力是资产负债表:OpenAI 需要一个有足够资本实力来承担巨额 GPU 投入的合作伙伴,而甲骨文恰好具备这一条件。

英伟达在 AI 芯片领域的主导地位并非一蹴而就,而是其创始人黄仁勋(Jensen Huang)一系列 "疯狂" 且高风险赌注的结果。迪伦·帕特尔将黄仁勋比作 "半导体界的沃伦·巴菲特效应",并深入剖析了英伟达建立强大护城河的历史策略。

帕特尔透露,英伟达在早期经历多次失败,但黄仁勋疯狂到敢于押上整个公司。他曾为了 Xbox 项目,在微软下订单之前就订购了所需数量的芯片,这种 YOLO(You Only Live Once,你只活一次)式的豪赌贯穿了英伟达的发展史。

在加密货币泡沫时期,当所有人都在怀疑 GPU 需求是否真实时,英伟达成功说服供应链合作伙伴,这不仅仅是加密货币,更是游戏、数据中心和专业可视化等 "持久的真实需求"。他们诱导供应商增加产量,并在泡沫破裂时,英伟达只需注销一个季度的库存,而其他公司(如 AMD)则会因犹豫不决而错失良机。

黄仁勋的另一大特点是其非凡的直觉和远见。帕特尔分享了一个关于黄仁勋和 CFO 科莱特的趣闻,黄仁勋曾说:"我讨厌电子表格。我不看它们。我就是知道。" 这种直觉使他能够多次提前预判市场需求,甚至给出比客户内部计划更高的产能预测,并敢于提前下达 "不可取消、不可退货" 的订单。

更令人印象深刻的是英伟达在芯片设计和制造上的执行力。阿彭策勒曾表示,在英特尔时,他们非常嫉妒英伟达,因为英伟达总能在第一次交付时就成功(first pass success),通常只需提交 "A0" 版本,而其他公司(如英特尔)可能需要多达 15 次修订("E2" 版本),这大大缩短了产品上市时间。这种高效的执行力使得英伟达能够迅速响应市场变化,及时交付创新产品,例如在 Volta 芯片投产前几个月,大胆地加入了张量核心,从而奠定了其在 AI 领域的领先地位。

英伟达的护城河并非仅仅是技术和市场份额,更是黄仁勋这种只为下一局而赢的独特领导哲学。 帕特尔引用黄仁勋的话:"玩游戏的目的是为了赢。赢得目的,或者说,赢得原因是为了你可以再次玩。" 这种不断追求下一代技术突破、而非固守现有成就的基因,是英伟达长青的秘诀。

随着 AI 算力需求的飞速增长,全球数据中心的建设正在以前所未有的速度和规模进行,行业已正式迈入 "吉瓦时代"(1 吉瓦等于 10 亿瓦)。迪伦·帕特尔指出,曾几何时,训练 GPT-3 需要 2 万个 H100 GPU,令人印象深刻;而现在,全球已拥有至少 10 个 10 万个 GPU 集群,分析师们甚至对 "兆瓦级" 的数据中心感到 "无聊",只有 "吉瓦级" 的建设才能引起他们的兴奋。

在这场史诗般的建设狂潮中,埃隆·马斯克(Elon Musk)的 X AI 和 Colossus 项目成为了一个引人注目的案例。帕特尔详细描述了马斯克在田纳西州孟菲斯的惊人壮举:在短短六个月内,从购买工厂到部署 10 万个 GPU,建成了一个液冷数据中心。他采用了一系列 "疯狂" 的创新做法,包括将发电机直接安置在工厂外、挖掘天然气管道获取电力、部署移动变电站等,以最快速度获取能源和冷却。

马斯克的建设速度和 "第一性原理" 思维,甚至让他能够挑战地方政府的监管。帕特尔提到,马斯克在孟菲斯遇到抗议后,直接将部分基础设施转移到密西西比州边境,利用不同州之间的法规差异来加速建设。这种打破常规的执行力,是推动 "吉瓦时代" 数据中心建设的关键。

然而,如此大规模的AI基础设施投资也带来了新的挑战:英伟达作为最大的现金流公司,面对未来数千亿美元的现金盈余,其资本部署策略成为了一个开放性问题。黄仁勋因监管审查无法进行大型收购(如ARM),那么这些巨额资本该何去何从?

帕特尔认为,**英伟达投资数据中心和电力设施,解决算力增长的瓶颈,可能比投资云服务本身更具战略意义。**但他同时也承认,黄仁勋在投资新云、模型训练公司等方面也在积极布局,只是这些都是小打小闹,无法完全消耗其庞大的现金流。这一困境,与苹果公司在库克时代因缺乏远见而将大量现金用于股票回购,导致创新停滞的案例形成了鲜明对比。

新一代 AI 硬件虽然性能飞跃,但其部署带来的高昂成本和复杂挑战,让使用者和云服务商都面临着新的难题。 帕特尔分析了英伟达 GB200(将 GPU 和 CPU 集成在同一个芯片上)的 TCO(总拥有成本),指出其大约是 H100 的 1.6 倍。虽然在特定工作负载(如深度探索推理或强化学习)下,GB200 能提供超过 6-7 倍的性能提升,使投资变得物有所值,但对于其他通用型任务,性能提升可能仅为 2 倍左右,收益便不再那么显著。

GB200 在部署中最大的挑战是可靠性问题。帕特尔透露,作为一个新 GPU,GB200 仍面临一些可靠性挑战,且其故障的 "爆炸半径" 远超前代产品。在一个包含 72 个 GPU 的 GB200 机架中,如果一个 GPU 出现故障,可能导致整个机架需要离线维修。这与 8 个 GPU 的 H100/H200 盒子不同,后者故障时只需替换单个服务器。

为了应对这一挑战,用户和云服务商不得不设计复杂的基础设施管理策略,例如将高优先级工作负载运行在 64 个 GPU 上,而将低优先级工作负载运行在剩余的 8 个 GPU 上,以减少故障对核心业务的影响。云服务商也因此调整了服务等级协议(SLA),例如提供 64 个 GPU 99% 的可用率,而非 72 个。这最终将迫使客户必须具备处理这种不可靠性的能力和智能。

此外,帕特尔还详细阐述了推理工作负载的细分:预填充(Prefill)和解码(Decode)。这两个操作需求截然不同,前者需要巨大的浮点运算能力,后者则对延迟和每秒令牌数(TPS)敏感。OpenAI、Anthropic 等顶级实验室,以及众多云服务商,都已开始分离预填充和解码工作负载,在不同的 GPU 集群上并行运行,以提高效率和用户体验。

英伟达也顺应这一趋势推出了专门用于预填充的 Rubin 预填充卡(如 CPX)。CPX 通过剥离 HBM(占据GPU成本一半以上),提供了一个更便宜、更高效的预填充芯片,从而有效支持长上下文AI模型的部署。这不仅降低了成本,也提高了整个推理过程的效率。

在快速变化的AI前沿领域,RL(强化学习)环境作为训练AI代理的关键技术,正吸引着硅谷的巨大关注。文章指出,RL 环境旨在通过模拟真实软件应用中的多步骤任务来训练 AI 代理,这对于开发更强大的通用型 AI 代理至关重要。

Anthropic 等领先的 AI 实验室正大量投入自建 RL 环境,而像 Mercor和 Mechanize 这样的初创公司,以及 Scale AI 等传统数据标注巨头,也在积极布局,希望成为 "RL 环境领域的 Scale AI"。

然而,RL 环境的未来并非一片坦途。帕特尔强调,"人们低估了扩展(RL)环境的难度。" 一些业内专家也指出,RL 环境容易出现 "奖励欺骗(reward hacking)" 问题,即 AI 模型通过作弊而非真正完成任务来获取奖励。OpenAI 高管对 RL 环境初创公司持谨慎态度,而 AI 研究员 Andrej Karpathy 虽然看好 "环境和代理交互" 的潜力,但对 "强化学习本身" 能带来多大进步持保留意见。

这表明,RL 环境虽然被视为 AI 代理突破的关键,但其技术挑战、扩展成本和有效性仍有待时间验证。

正如帕特尔所言,预测超过五年后的未来几乎不可能,因为每次的情况都是一个全新的局面。在这个由技术、资本和地缘政治交织的狂野西部,黄仁勋那句 "游戏的目的是为了赢,赢得目的,或者说,赢得原因是为了你可以再次玩" 的哲学,或许是对这场高 Stakes 变革最恰当的注脚。

本篇转载自公众号 Web3 天空之城,如需查看视频及中文翻译请访问原文。

(声明: 观点仅供参考,不代表机构立场。)