曦望Sunrise徐冰:未来十年,AI最大的机会在哪里?|心星 PORTFOLIO

为 AI Agent造房子,建规则。

曦望Sunrise徐冰:"未来十年最大的机会,是为 AI Agent'造房子'。" 7月17日,WAIC 2026启幕之夜,曦望Sunrise董事长徐冰受邀出席"WAIC的清华朋友圈之夜" ,**与图灵奖得主 Richard Sutton,以及来自人工智能、创业和投资领域的嘉宾共同展开对智能未来的讨论,并发表题为《与 Agent 共生,与同路人共造——Agent时代的推理基础设施与创业地图》**的主题演讲。

如果说 Sutton 关注的是如何让机器人通过学习理解环境、完成行动,那么徐冰进一步讨论的,是当机器智能走出实验室、进入企业和日常生活之后,人类将如何与它共同工作,又需要为这种新的关系准备什么。机器如何学会行动,是智能发展的起点;人与机器如何组成新的社会和生产体系,则是下一阶段必须回答的问题。

首先被重塑的是人与机器的关系。 徐冰认为,Agent既可以是与人共同判断、协同创造的搭档,也可以是接受任务、自主执行的"数字员工"。它不再受限于人类的在线时间,可以持续工作、批量完成任务,并由此改变企业的组织结构与生产方式。未来的公司,或许不再只是人的集合,而是由员工与Agent共同构成的新型组织。

这种新组织需要新的基础设施。在徐冰看来,Agent要长期运行,不仅需要更充足的算力,还需要软件调度、内存管理、芯片配置,以及云、端之间更合理的协同。围绕Token成本、数据隐私、模型部署和软硬件联合优化,新的产品形态与创业机会正在出现。

而当Agent真正成为社会和企业中的行动主体,一套围绕它的辅助体系和运行规则也会随之诞生。徐冰也由此提出了一系列新的现实命题:如何核算每个数字员工的成本与产出,如何追踪其权限、行为与责任,如何为可能造成的损失提供保险,又如何盘活分散、闲置的算力资源。 而Token FinOps、Agent保险、利用率管理等新领域,正试图回答这些问题。它们不仅是新的岗位和生意,也可能构成未来人机协作社会的基础制度。

从机器如何学习,到人与机器如何共同生活和工作,一个新的世界正在被打开。

以下为徐冰现场演讲实录:

2014年,我在清华科技园与几位清华同学联合创办商汤科技。我本科就读于香港中文大学,修读数学与信息工程双学位,之后成为汤晓鸥教授的博士学生。

汤晓鸥教授创办的香港中文大学多媒体实验室,是国内深度学习领域最早的开拓者之一。2012年前后深度学习发展早期,我们实验室是国内该领域论文产出最多的机构。

创业初期,我们凭借数十张消费级 GPU显卡搭建基础算力环境、训练小型神经网络,主攻计算机视觉方向。2014年,我们在清华南门正式成立商汤科技。

回顾**十多年创业之路,我总结出一条深刻经验:行业永远会出现比你更勤奋、更聪慧、更有才华的人。创业切忌自满,不要认为自己创下的成绩无法被超越,源源不断的优秀年轻人终将突破前人创造的成果。

一代代新锐青年创业者不断突破行业边界、刷新创新成果,这也是我近年来也致力于投资、支持青年创业者的核心初心。

2014年,行业内几乎没有"AI"这个概念,那时我们对外输出的核心是计算机视觉技术,把人脸识别、智慧城市的视觉方案做成普惠化、标准化的通用产品,让人工智能像水电一样,成为低成本、可全民普及的基础设施,这也是一代代AI创业者共同的初心与愿景。

基于这个愿景,我开启第二次创业,深耕 GPU 与 AI 推理芯片赛道,曦望从底层算力出发,持续降低人工智能的使用成本,实现算力普惠。

行业转折:智能成为可采购的基础设施

回望过去十余年行业发展,模型规模持续扩大,算力资源不断扩容。过去十年,训练能力决定了 AI 发展的上限,如今这一上限已经被抬到极高水平。而2026年是行业关键转折点:市场开始大规模为顶尖大模型付费,不少用户每月为模型支出上千元,甚至频繁耗尽 Token 额度。一年前这样的市场需求完全不存在,今年才是大众真正认可的 Token 商业价值的元年。

国内外涌现出许多强大的、万亿参数的大模型,用户愿意为此付费。企业与个人开始重视 Token 使用成本,这背后是智能供给逻辑的根本性变革。

长久以来,顶尖智能属于稀缺资源,依赖高校长期培养专业人才,顶尖人才的培育周期漫长、供给有限,高端智力如同奢侈品。但当下全新的时代已经到来,顶级智能成为可按需采购的标准化商品。这类可采购的商品定价每月上千元,且有海量用户愿意买单,直接带动全球头部大模型厂商的营收指数级增长。

智能正式转型为可采购的数字基础设施。行业内有一个值得所有人深思的判断:即便算力硬件产能每年扩容四倍,未来十年依然无法满足AI的需求。

核心原因是全新物种 Agent 的诞生。Agent 会持续消耗海量算力,消耗Token 完成各类任务,它实现了智能任务与人类时间的完全解耦,未来 Agent 的总量或将远超人类。全球人口约 80 亿,而 Agent 数量未来有望达到数百亿规模。人类搭建了写字楼、住宅等实体基础设施,但海量 Agent 还没有适配的运行载体与算力环境。

Agent 时代:人机共生与生产力革命

从当下到未来十年,我们将正式进入人机共生时代。Agent 有两种核心定位:

第一种是个人协作场景下的搭档。我们以使用者为主导,与模型来回沟通、协同推进任务,人类把控整体方向,Agent 辅助思考、实时交互、并肩协作、答疑、落地各项工作。

第二种是企业工作场景下的下属执行者。人类下达完整任务指令,Agent 自主拆解流程、批量完成重复性、标准化工作,承接大量落地执行环节,释放人类的创造力。

我们看到,现在企业开始大规模采购 Token,引入 AI Agent 作为"数字员工",与人类员工协同工作。人分配任务,Agent 执行任务,完成后人再验收成果,类似于日常管理初级程序员的方式。Agent 不需要休息,可以 7×24 小时不间断运行,时间与人类时间完全解耦,不再受限于人类每天七八个小时的在线时长。Agent 并非切分存量的蛋糕,而是创造历史上不存在的增量市场。

我们回顾历史,人类经历了三次重大的生产力革命。工业革命放大了人类的肌肉与体力,信息革命放大了人类的注意力与信息传播效率,而 Agent 时代的到来,人类的时间终于被彻底解放——这是历史上从未经历过的事情。

要实现 Agent 的大量繁殖和长时间运行,需要系统性地解决关键技术问题:软件调度,协调大量 Agent 的任务分配与执行;内存管理,支撑 Agent 长期运行所需的记忆存储;芯片配置,为不同场景匹配最优的算力和内存方案。在我看来,未来十年最大的机会,是为 AI Agent "造房子"——建设 Agent 所需的基础设施。 这是整个行业当前最紧迫的任务。

高带宽内存(HBM)作为 AI 训练和推理的核心部件,面临严重的供应瓶颈。HBM 采用多层堆叠工艺,生产复杂、扩产较难。Agent 基础设施建设的爆发性需求直接推动了内存厂商的业绩飙升。

在 HBM 扩产困难的情况下,全行业转向了一个新的解法——LPDDR(Low Power DDR),即消费级内存,生产方式简单,供应链充足,容易扩产;量产成本数倍优于 HBM;能放下更大参数的模型;支持 Agent 与用户长期互动中积累的记忆。高通、英特尔、英伟达、苹果等芯片厂商的推理芯片都用了几百GB LPDDR 来扩充显存容量。

在Agent系统里,内存不只是显卡的一个配置参数,它是数字员工的工位。工位越大,一台机器养得起的Agent越多,每个Agent记得住的事越久。极高带宽场景与训练负载仍更适合HBM,曦望第三代GPU用大容量LPDDR,在长上下文、高并发等容量敏感的Agent负载上,做出更低的真实任务成本。

端侧拐点来了,将带动推理需求大爆发

云端 AI 正从"野蛮生长"进入"高成本稳态"。全球云厂商投入数万亿美金 Capex 建设 AI 数据中心,云端模型参数量已达万亿规模,API 收费已被市场普遍接受。然而,Token 账单已成为企业最需要关注的成本项。随着电力不足导致的 Token 价格持续上涨以及限流措施的出现,Token 账单的金额甚至超过了话费和电费,企业必须加强对此类成本的控制。与此同时,端侧正在迎来三个关键拐点。

第一,算力跃升。端侧芯片算力从历史上的 100-200 TOPS 向 1000 TOPS 级迈进。

第二,内存扩容。端侧存储逼近200 GB,配合大容量 LPDDR 方案,可以容纳更大参数量的模型。

第三,智能密度提升。清华大学"密度法则"揭示大模型能力密度每3.5个月翻番,如今还在加快,这预示一两年内200-300B模型可比肩当前云端旗舰。

换言之,当前用户每月花上千元订阅的云端模型能力,未来可直接部署到终端设备上,实现永久Token免费。端侧 AI 的杀手级应用场景将集中在数据不出端的需求上,尤其是隐私敏感型任务。这些应用的真实天花板由内存容量和内存价格决定,而随着 LPDDR 方案的推广,这一天花板正在被持续推高。如果推理成本降低90%,很多历史上不赚钱的应用场景将转变为可盈利的商业模型,进而带动推理需求和算力需求的爆发性增长。

畅想一下未来的端侧长什么样?我认为端侧可能诞生iPhone或者大疆无人机级别的产品。

第一个畅想:24 小时随身算力。

想象一台电脑,能 7 天 24 小时一直跑,你花几万块钱买回来,就等于雇了个初级工程师。它可以在你白天写完代码之后,帮你查问题、改 bug、做迭代,而且全天不停。

端上有两个好处,是云替代不了的。一是不产生云端按 Token 计费的费用,二是数据、代码、隐私安全都在自己手上,不会上传到云端。

它一年消耗的 Token 量,可能价值十万、二十万。所以在端上,这台电脑你可以认为它是半年就能回本的 Token 工厂。

第二个畅想:手机的分身。

手机也值得去做一个分身。手机有物理空间的限制,你很难在手机里放下200B的模型,但可以做的是一个类似充电宝这样的分身,手机就是界面。这个类似充电宝的东西跟你的手机通信,里面装入一个足够强劲的私有化大模型,来帮你处理你的微信、照片,所有那些隐私的、不方便上云、不方便外传的东西。它会变成最懂你的那个存在,因为它会跟随你很多很多年,它会跟着你长大,看着你读书,陪着你工作。

Agent时代创业地图:重塑数字基础设施的系统性机遇

Agent时代有诸多创业机会,我按照算力层、端侧层、应用层、Co-design服务层来与大家分享、共创。

应用层,创业的核心不再是开发另一个Chatbot,而是重构商业逻辑。这里有五个具体的机会。

第一,按结果计费的垂直行业 Agent。Agent 时代最好的应用创业,不是给原有的软件加一个聊天框,而是去找一个客户愿意按结果付费的单元——一个工作单元,标准化的,然后可以规模复制,成为一个数字化的生产线。

第二,Token成本精算(Token FinOps) 。云时代的 FinOps 回答了一个问题:每个业务部门到底花了云上多少钱?那 AI 时代,新的 FinOps 就要回答:我们雇佣的每一个数字员工,他花了多少钱?完成了什么任务?结果好不好?还值不值得继续为他付费?

第三,模型和硬件的联合优化。在 WAIC期间新发布的芯片,已经是数以百计了,我们有很好的芯片创新生态,我们缺的是把某个模型在某种硬件芯片上跑到极致的人。未来就有可能出现一批"推理适配代工厂"——它不生产芯片,也不做模型,但是把两者加工成可量产交付的推理产品。

第四,** Agent 保险**。人类需要保险,Agent 时代同样是这样。数字员工越多,我们越需要知道哪个 Agent 做了什么、为什么做、出了问题能不能回放、损失由谁承担。未来的 Agent 需要为自己的结果负责任,重要的Agent可能需要自己的身份证、自己的权限、行为记录和风险评级。

第五,利用率银行。部分数据中心,以及企业自建的智算集群利用率较低,这些资源就是现成的库存,是没被用起来的算力。但到底哪些部分是可以被用起来的?它可以是迁移的、可计费的、可适配的,这些都是离现金流非常近的、可以及时去挖的金矿。创业机会不是去做一个调度器,而是去做一个"选矿厂",把分散的异构的卡提炼成客户可以稳定运行和购买的产品。

这四层里面有非常多的创业机会。算力层,让每一度电、每一 GB 内存、每张卡都高效转化成 Token。端侧层,一旦一个两三千亿参数的模型能装到你口袋里的设备里,那去做 iPhone 级别新产品的机会就出现了。应用层,我们把客户"百万 Token 一分钱"的计费方式,变成办成一件事、做一个任务需要多少钱。最后,Co-design服务层,将模型与硬件的联合优化,是兑现技术价值的关键,这也是 Deepseek 验证过的价值。

最后,我想分享属于今天中国AI创业者难得的时代机遇与优势。

我们常说中国 AI 产业有三张王牌:第一梯队的开源大模型能力、可规模化扩产的内存供应链、充足稳定的电力资源。 三者叠加,让我们拥有了全球最具优势的 Token 量产基础,也让"为 Agent 造房子"这件事,有了在中国率先落地的底气。

我们要交付的从来不是一颗芯片、一台服务器,而是一套 "可负担、可拥有、可部署" 的完整推理基础设施,是给所有做应用、做端侧、做服务的创业者,搭好一个足够稳、足够便宜的地基。曦望愿意做这个扎在底层的搭台人,把推理芯片做透,把 Token 工厂的底座打牢,给 Agent 装上原生的算力发动机。

今天在场的有一路同行的投资人和创业者,我们都是 Agent 时代的同路人。未来十年,智能的边界会不断拓宽,创业的机会会源源不断。愿我们与 Agent 共生,与同路人共造,一起把算力普惠的愿景,变成实实在在的产业现实。

谢谢大家!

心资本成立于2022年,是一家专注于投资中国早期科技创业企业的风险投资基金。

心资本的团队主要由光速中国的创始合伙人、核心投资人以及来自产业的资深投资人组成。团队过往投资案例包括沐曦股份(688802.SH)、小鹏汽车(NYSE:XPEV,09868.HK)、满帮集团(NYSE:YMM)、商米科技(06810.HK)、速腾聚创(02948.HK)、Ambiq Micro(NYSE: AMBQ)、汉朔科技(301275.SZ)、信也科技(NYSE:FINV)、奇梦岛集团(NASDAQ:HERE),以及蓝箭航天、微纳星空、百川智能、运满满冷运、环世物流、樊登读书、蓝湖等。

心资本扎根中国,放眼全球,致力于早期陪伴和支持有潜力成为中国科技领域未来世界级公司的创业团队。心资本倡导"心"的价值,相信科技可以成为链接心灵的桥梁。心资本期待陪伴更多中国年轻企业家走向世界。