扩散语言模型驱动的实时交互视频模型:SigmaZ 完成数百万美元融资

Pixel 擅长表达 appearance,Code 擅长表达 structure;未来会进入 Pixel-Code 联合的视觉表达。

Pixel 擅长表达 appearance,Code 擅长表达 structure;未来会进入 Pixel-Code 联合的视觉表达。

👦🏻 作者: 壹小姐

🥷 编辑: Koji

🧑‍🎨 排版: NCon

在视觉AI交互模型的热门赛道,一条新的路线正在从像素底层(Pixel-based)中分出来——代码路线(Code-based)。

基于当前主流的AI视频模型,一支广告可能只需要改一个商品价格,却要重新生成整条视频;同一套产品说明,因面向不同客户只需调整个别细节,却要重新输出几十个版本……

在纯像素的视频底层模型中,视频是非编码的形式、一经生成便是完成式,任何细微的改动都需要重新生成一次;而如果底层是代码,需要修改的将只是对应的文本、组件、参数或数据源——这正是代码路线的空间。

近日,基于扩散语言模型(DLM)的实时交互视频模型公司——SigmaZ AI,宣布完成数百万美元融资。资方包括蓝驰创投、云启资本(Y Transformers首批被投企业)、德迅投资、XIAOXIAO FUND 小小基金,以及多位知名投资人跟投。

交互智能实验室 SigmaZ AI 由 2003 年出生的剑桥连续创业者杨博麟 William**,和 Amazon AGI Lab(伦敦)旗舰模型视觉代码训练技术主管 Derek Law 联合创办。**

SigmaZ AI专注于两件事:Diffusion-LM 的模型训练,以及基于视觉的模型自进化框架(Vision-guided RSI)。**

它训练模型直接生成视觉代码,产出的是可实时交互、能当场修改的"活的画面",与像素固化的传统视频形成本质区别。其旗舰产品 Tap8 即将正式发布。

7 月 22 日,这家公司发布的一条视觉交互demo视频在 X 上,6 小时冲到近 8 万播放,当天登上 Today's News 榜首,24小时内吸引了数千名内测用户加入waitlist,而且促成了SigmaZ AI 与20多家B端意向合作方的签约。

AI交互视频走进日常,卡点在哪里?

想象你正在和 AI 开一场视频会议。

你当然希望看到对面的脸。人的表情、动作、眼神、情绪——这些高熵而模糊的信息,最适合用像素表达。

但如果 AI 此刻要向你解释一家公司的财报,你大概不会希望它举着一张纸在镜头前念数字。

你希望它共享屏幕。图表应该是图表,数字应该是可以读取的数字,按钮应该可以点击,3D 产品应该可以旋转,流程应该可以展开,某一个对象发生变化时,系统应该知道究竟是哪一个对象变了。

以上这两种信息,本质上属于不同的模态。

像素 Pixel 擅长表达 appearance(外观),代码 Code 擅长表达 structure(结构)。 前者负责"这个世界看起来是什么样",后者负责"这个世界里有什么、它们之间是什么关系、以及我可以对它做什么"。 回顾过去两年,AI 的想象力一直被"对话框"所限。无论是打字还是语音,交互的方式仍然是传统的一问一答。

现实中,人类的很多好奇心其实很难被翻译成精准的文字。

比如:看耳机测评时,我们会想直接看看内部结构 ,而不是读一段描述内部结构的文字;跟着视频健身时,我们会更想直观、无延迟地知道当下的这个动作对不对…… 原本应该是视觉化的内容,但模型只能用文字来表达。 而信息原本就长在画面里,如果硬要转化成提示词(文字形式)再输出**,这本身就是在绕远。**

这背后,一个被忽视的根本性问题是:人与AI之间不断拉大的差距其实不在智能,而在"信息带宽"。 有一组数字更直观地体现了人和 AI 之间的带宽距离:成年人静默阅读速度约每秒 5 个 token,而前沿模型今天的输出已经达到每秒 300个 token。

模型每提升一点吞吐,都在显著拉开人与AI间的差距。

一个专心的读者对一个模型的差距大约是60 倍;如果十个 agent 并行,差距将达到 600 倍。

在SigmaZ AI 看来,想要弥合这个差距,真正该换掉的不是模型,而是模型与人之间的那层交互界面。 早在今年5月,OpenAI 创始成员Andrej Karpathy 便曾在 X 上写道:人脑大约三分之一的算力用于处理视觉,视觉是信息进入大脑的十车道超高速公路;AI 输出的形态会从纯文本,到 markdown,到 HTML,最终将走向由模型直接生成的可交互视频。

在这条AI视觉交互模型赛道上,不同于纯Pixel-based式,SigmaZ AI 选择的正是"像素代码混合式"路线:画面仍以视频、动画或场景呈现,但背后不再只有像素,而是有一套可以被理解、修改和持续更新的内容组织方式。

目前,市面上不乏关于交互视频和世界模型的探索,但多数集中在"游戏引擎"和"机器人仿真训练"领域,服务对象是开发者和特定产业企业,离普通人的手机屏幕都较远。

SigmaZ AI 选择的服务场景是:把交互视频带进日常使用场景——做通用型平台。 这也意味着,SigmaZ AI 要跨过的门槛已经从"能不能做出 Demo"升级为极度现实的工程化突破——反馈要够快、生成质量要够稳、推理成本要能撑住高频使用。

SigmaZ AI 的"技术飞轮"

如何实现这样高的工程化突破?

SigmaZ AI 团队选择从 infra 做起,它做了三个核心的技术押注。这三个押注互相咬合,共同构成了这家公司的技术壁垒,也形成了它的技术飞轮。

第一,生成媒介从"像素Pixel"转向"代码像素混合 Code-Pixel Mix"——两者分工配合。 该交给"代码"的任务交给代码,该交给"像素"的任务交给像素扩散。

其中,代码 Code 负责结构、因果、交互和状态——这些低熵、需要"准确"的部分;像素 Pixel 扩散则负责纹理、细节和开放世界的高熵内容——负责"美观、好看"的部分。

纯 Pixel 视频模型输出的是像素流,画面一经生成随即固化;而 SigmaZ AI 可以让模型输出可执行的前端代码,渲染之后再形成画面。

通俗来讲,这样生成的画面,里面的元素仍然是"活着"的;交互本身即是媒介的组成部分,而非附加在视频上的外挂功能。

需要注意的是,代码作为媒介,其难点主要不在生成侧,而集中在训练侧。 因为给视觉代码打分,意味着必须先把它渲染出来,但训练中那些故意冒险的生成尝试,往往会把渲染环境直接跑崩——动画和 3D 尤其如此。

于是,SigmaZ AI 自研了一套基础设施,能够安全渲染、截屏、给不稳定代码打分,而且即使代码不稳定也不会阻塞训练集群;同时,可以在集群之间做"异步协调"和"批处理",让视觉评审模型的打分能够理性地回流到训练中。

这条工程路径的难度远高于"让模型输出代码"本身,因为这里面存在大量行业尚未系统化的工程挑战。

第二,从推理时扩展(Test-Time Scaling)到自进化:基于视觉引导递归自进化的多模态模型 在模型层面,SigmaZ AI 可以实现自进化。

"我们的DLM模型能够通过在线学习协同离线强化学习,把每一次在线环境中的编辑轨迹蒸馏到模型权重当中,实现自主地以周为维度去迭代,持续提升模型的视觉表达能力",SigmaZ AI 创始团队称。 事实上,扩散语言模型(DLM)长期被诟病的一个问题是,单次生成的智能上限还不够高:面对复杂的视觉代码任务,模型很难一次就把结构、逻辑和视觉效果同时做对。

SigmaZ AI 的思路不是要求模型"一次答对",而是先通过推理时扩展(Test-Time Scaling),让模型在单个任务上多思考、多试错。

具体流程上:代码生成后被真实渲染出来,然后由视觉评审模型找出问题、反馈给 coding agent 继续修改,通过多轮"生成—渲染—评审—修改",不断逼近更好的结果。

过去,这类循环最大的问题是太慢,很难真正进入实时生产环境。

而 DLM 更快的生成速度,让这件事第一次变得可行:它把节省下来的推理时间重新"花"在多轮评审和修正上,用速度换来了更高的智能上限。

SigmaZ AI 实测显示,即使加入 RSI 循环,首帧生成时间(Time to First Frame)依然可以控制在数秒内。 但是,如果每次都从头跑几轮,模型只是"会改",还谈不上"会进化"。

因此,SigmaZ AI 的第二步是训练时内化(Training-Time Internalization)。

SigmaZ AI 把这些推理过程中产生的批评、修改和最优轨迹重新变成训练信号,蒸馏回模型权重,让这一次在五轮试错中学会的东西,下一代模型可能第一轮就能做到。

最后,SigmaZ AI 也在做评审器进化(Evaluator Evolution)。

从技术维度来看,视觉代码递归自进化的难点,不在跑通一次循环,而在评审标准本身会过时。

因为在代码和数学的世界里,对就是对,而"好看不好看"却是主观的,人的品味一直在变。甚至 AI 产出越多、变化越快,而固定的评审只会把模型训练成去年的审美。

当前业内的普遍做法是,训好一个评审模型就固定住,但这其实并不能满足视觉AI实时交互的需求。评审本身也需要被持续重训、持续进化。

对此,SigmaZ AI 设计了"元评审层"的持续校准。

"元评审"agent 会专门盯着评审 agent 和人类专家打分不一致的地方,自动去跑实验、重新校准评分标准,直到它和人的判断更吻合;同时,另一个"元编码"agent 会批量分析评审反馈,从中找出写代码的 agent 反复犯的系统性错误、提出改法,并在通过回测后允许上线。

整个过程中,人类专家可以全程抽检。确保循环是朝着人类需要的方向优化,而非 agent 跟着自己的感觉走、越练越偏。

以上三个循环(推理时扩展、训练时内化、评审器进化)接在一起,形成了真正的模型自进化:推理产生经验;经验沉淀为能力;不断进化的评审标准决定下一轮模型该朝哪个方向变强。 值得注意的是,SigmaZ AI 的评审标准背后,是一个积累了数年的约 1000 人规模的按需专家网络。

这些专家全部来自 QS 前 200 高校,覆盖 9 个垂直领域,75% 是硕士、25% 是博士。而且,他们不只是打分,他们更重要的作用是"校准自动评审模型"。目前,SigmaZ AI 可以实现标注者之间的一致性落在 0.67 到 0.91 之间。

这套方法由SigmaZ AI CTO Derek Law 作为核心作者写成了论文《Vision-Guided Iterative Refinement for Frontend Code Generation》,发表在 ICLR 2026 的 RSI Workshop 上。

不过,论文出于验证的考量,采用的是最简单的一种蒸馏方式,即只喂任务描述和最终结果;但在SigmaZ AI 的内部训练上,要比论文更进一步。

"我们在完整的改进轨迹上做训练,把每一轮'哪里不好、该怎么改'这个过程本身,也变成了训练信号。论文里的数字是这套方法的下限,不是上限",SigmaZ AI 联合创始人兼 CTO Derek Law说。

第三,为实时生成重做模型栈:Diffusion-LM 与全栈后训练。 自回归模型代码写得很好,但问题出在速度上——它是逐 token 串行往下吐,速度约每秒 100 token。

如果想要生成一个内容丰富的场景,需要好几分钟。这个速度做离线渲染是够用的,但做实时交互就是致命的短板。

对比来看,"自回归模型代码"和"DLM",是两种截然不同的"写法":

自回归就像手写,是一个字一个字、线性地往下写;而扩散语言模型(DLM)就像先铺一整张草稿画布,然后用很少的几步、去整体打磨,不同位置的修改都可以同步推进。 A DLM instantiates a canvas of tokens and iteratively refines every position in parallel.

SigmaZ AI 团队很早就把 DLM 系统性地用在了实时交互视频上。

现在,DLM 并行解码在代码生成上,业内最高能跑到每秒 2146 token,它高出自回归模型代码一个数量级,后者是每秒约 100 token的水平。未来,一个场景的修改,将不再需要等一分钟,几秒钟就能出来。

SigmaZ AI 的优势在于时机,而不是运气。 延迟一直是实时交互视频绕不开的一堵墙。业内通行的做法是在自回归上用缓存、路由做边际优化;而SigmaZ AI 团队在 DLM 落地之前,就笃定范式必然会切换。

基于此,SigmaZ AI 很早就把工程重点投入在"视觉质量、评测体系、自进化基础设施"这些"换范式之后依然重要"的问题上,并逐一解决了。

等到 DLM 一到位,SigmaZ AI 要做的就是补上最后一块拼图,而不用从头开始。 同样是做DLM,Inception的Mercury和Google的Gemini Diffusion走的是通用横向路线,模型本身就是产品。SigmaZ AI的路径与之不同:它把基座模型后训练成精于动态图形代码的专家,然后叠上了自研的训练框架、评测栈和数据飞轮。

底座模型是市面上能买到的通用件,但围绕它构建的这套垂直整合系统,是买不到的东西——这是SigmaZ AI 真正的护城河。

"post-training 只是第一步。" SigmaZ AI表示,"下一阶段,SigmaZ 会进入到 Pixel-Code joint training。Code 和 Pixel 将不再是两套彼此独立的模型能力,而是同一个世界模型表示之上的两种 decoding path。"

整体来看,以上三个技术押注互相支撑,共同构成了SigmaZ AI 的技术飞轮: "代码像素混合"让交互成为可能;递归自进化让模型越用越好;DLM后训练让它快到能真正实时交互,同时抬高了质量的天花板。 今年 7 月,SigmaZ AI 对内部生成引擎做了一次横向评测:覆盖 7 个主流系统、5 类真实场景、25 个具体场景共 173 段视频,独立标注者盲评产出 6,760 条人工标注。

评测数据显示,在信息密集型场景里,SigmaZ AI 引擎拿到了综合质量、事实覆盖率、文字准确度三项第一,内容理解正确率并列第一,表现优于Fable 5、Seedance、Veo。

此外,自动化评测模型 VBench++ 在完全不知道人工标签的情况下,也独立复现出了高度一致的排序(Spearman ρ = +0.89)。VBench++ 是目前视频生成领域最权威和全面的自动化评测体系之一。

当然,对 SigmaZ AI 而言,这套 Benchmark 数据只是起点。接下来的产品发布,才是检验这家公司实力的真正考验。

SigmaZ 这套模型能力的首个产品化尝试—— Tap8,是一款定位为"实用且有趣的实时交互内容平台",预计 2026 年内推出。 为什么是SigmaZ AI?

"通用型实时交互视频不是单点算法或单个模型的竞争,而是模型架构、训练框架及渲染链路、产品体验和成本结构的系统工程。这三块能力在同一支团队里闭合,是以上三个技术押注能并行推进的前提。" 云启资本执行董事韩义表示**。**

SigmaZ AI 最核心的壁垒,便来自团队在模型训练、视觉生成和消费级产品这三块之间的复合 Know-how。 在团队构成上,SigmaZ AI 联合创始人兼 CEO 杨博麟(William Yang)是一位2003年出生的连续创业者,拥有华威大学和剑桥大学的学术背景。他曾把多个创业项目从零做到数千万营收并完成一次退出,对如何把一项新技术变成普通人愿意天天打开的产品,有着第一线的判断。

SigmaZ AI 联合创始人兼 CTO Derek Law 毕业于帝国理工学院计算机科学专业,他有近十年的前沿AI Lab经验,曾是 Amazon Alexa 首位华人算法研究员,负责Amazon旗舰模型从视觉代码训练到上线的技术开发。

在Amazon AGI Lab 期间, Derek 带领一支跨美、英、印三国的团队做基于 HTML 的可交互回答,2025 年初产品率先在 Amazon Nova 上线,它比 Google 的同类产品早 6 个月、比 Anthropic 早 11 个月。

上面提到的发表于ICLR 2026 RSI 的论文——《Vision-Guided Iterative Refinement for Frontend Code Generation》,他是核心作者。 两位创始人之外,SigmaZ AI 的核心团队还汇聚了来自 Amazon AGI、Alibaba AI Lab、ByteDance AI、Baidu 等一线实验室的资深研究员与产品负责人。

除了团队的 know-how,SigmaZ AI 的另一个优势在于"数据"。 交互视频是一个全新的品类,行业里既没有现成的公开数据集,也没有专门的数据公司提供标注服务。

过去一年,SigmaZ 在真实的生产环境中,积累了数十万条带有人类偏好标注的真实数据。

数据主要来自三个渠道:

  • 首先,C端消费者产品。

在行业普遍对"用代码生成交互视频"持观望态度时,SigmaZ AI 已从去年年底开始布局,通过首款C端消费产品积累了第一批种子数据。

  • 第二,B端试点合作。

方向明确后,团队与大量B端用户开展了试点合作。这些用户在真实场景和受控环境下使用产品,持续产生高质量数据。

第三,合成数据。

在前两类数据基础上,SigmaZ AI 团队进一步通过合成方式实现数据规模的扩展。

这三类数据互为补充:C端数据提供真实用户反馈,B端数据覆盖结构化场景,合成数据完成规模放大。它们共同构成了SigmaZ AI 模型后训练的核心素材,也反过来驱动RSI自进化闭环的持续运转。

"今天回看每一轮媒介革命,本质上都是一项底层技术重写了一次信息的载体。印刷术长出了报纸,无线电长出了广播,视频编码加流媒体,长出了今天的短视频平台"。谈及SigmaZ AI 的诞生时点,杨博麟表示。

"每一次媒介革命都是底层先变,新的媒介以及那个时代最大的平台,随之生长起来"。 这一次,SigmaZ AI 押注的,是以视觉为入口的下一代人机交互界面。 SigmaZ AI 认为,AI 就是下一个新兴媒介的底层,它真正的产物会是实时交互内容。

在技术实现上,Diffusion-LM 将成为实时交互时代的一种新模型范式, 而Code 会成为它连接视觉世界的重要原生语言。

届时,同一支视频,一百万人点进去,会衍生出一百万条视频。而承载视频层交互的界面,将是 AGI 时代人与信息之间最高频、最有价值的触点。

从二维播放,到实时交互;从观看者,到创作者;从对话框里的 AI,到画面里的 AI——SigmaZ AI 正在打开的,是一个信息被重新生成、被重新观看、也被重新提问的新入口。

参考资料

[1] 今年5月,OpenAI 创始成员 Andrej Karpathy 在 X 的观点:https://x.com/karpathy/status/2053872850101285137

[2] William Yang, SigmaZ AI Lab, "Communicating With Less Lost: Interactive Video and the Interface to Intelligence", SigmaZ AI Lab, July 2026.

[3] Vision-Guided Iterative Refinement for Frontend Code Generation. ICLR 2026 Workshop on Recursive Self-Improvement. https://arxiv.org/abs/2604.05839

[4] Brysbaert. How many words do we read per minute? Journal of Memory and Language, 2019.

[5] Artificial Analysis. AI 模型输出速度对比. https://artificialanalysis.ai/models

[6] ByteDance. Seed Diffusion. arXiv:2508.02193. https://arxiv.org/abs/2508.02193

[7] Google. Gemini Diffusion. https://deepmind.google/models/gemini-diffusion/