扩散语言模型驱动的实时交互视频生成公司SigmaZ AI,完成数百万美元融资|蓝驰家族
进入Pixel-Code联合的AI交互

近日,基于扩散语言模型(DLM)的实时交互视频生成公司SigmaZ AI 完成数百万美元融资,由**蓝驰创投领投,**多家机构参与投资。
交互智能实验室 SigmaZ AI专注于AI视觉交互赛道,利用Diffusion-LM驱动产出Pixel与Code结合的可实时交互、能当场修改的"活的画面",与像素固化的传统视频形成本质区别。其旗舰产品 Tap8 即将正式发布,让互动视频成为人与AI之间的交互界面。
SigmaZ AI由 2003 年出生的剑桥连续创业者杨博麟 William,和 Amazon AGI Lab(伦敦)旗舰模型视觉代码训练技术主管 Derek Law 联合创办。
蓝驰创投表示,AI技术的持续演进正在推动信息载体从"可观看"走向"可交互",并加速重塑内容生产与消费的方式。SigmaZ AI是具备用户真实需求视角和模型能力的连续创业团队,对Pixel与Code融合路线具备清晰判断,让我们看到了实时交互内容走向大众的新路径。实时交互内容正在成为AI时代的重要新媒介形态,蓝驰将持续关注与支持该方向的技术演进与产品落地。
以下是该项目的技术亮点及进展介绍,编辑整理自"十字路口",enjoy:

想象你正在和 AI 开一场视频会议。你当然希望看到对面的脸。人的表情、动作、眼神、情绪——这些高熵而模糊的信息,最适合用像素表达。
但如果 AI 此刻要向你解释一家公司的财报,你大概不会希望它举着一张纸在镜头前念数字。你希望它共享屏幕。图表应该是图表,数字应该是可以读取的数字,按钮应该可以点击,3D 产品应该可以旋转,流程应该可以展开,某一个对象发生变化时,系统应该知道究竟是哪一个对象变了。
以上这两种信息,本质上属于不同的模态。
像素 Pixel 擅长表达 appearance(外观),代码 Code 擅长表达 structure(结构)。
前者负责"这个世界看起来是什么样",后者负责"这个世界里有什么、它们之间是什么关系、以及我可以对它做什么"。
回顾过去两年,AI 的想象力一直被"对话框"所限。无论是打字还是语音,交互的方式仍然是传统的一问一答。
现实中,人类的很多好奇心其实很难被翻译成精准的文字。比如:看耳机测评时,我们会想直接看看内部结构 ,而不是读一段描述内部结构的文字;跟着视频健身时,我们会更想直观、无延迟地知道当下的这个动作对不对……
原本应该是视觉化的内容,但模型只能用文字来表达。而信息原本就长在画面里,如果硬要转化成提示词(文字形式)再输出,这本身就是在绕远。
这背后,一个被忽视的根本性问题是:人与AI之间不断拉大的差距其实不在智能,而在"信息带宽"。
有一组数字更直观地体现了人和 AI 之间的带宽距离:成年人静默阅读速度约每秒 5 个 token,而前沿模型今天的输出已经达到每秒 300个 token。
模型每提升一点吞吐,都在显著拉开人与AI间的差距。
一个专心的读者对一个模型的差距大约是60 倍;如果十个 agent 并行,差距将达到 600 倍。
在SigmaZ AI 看来,想要弥合这个差距,真正该换掉的不是模型,而是模型与人之间的那层交互界面。
早在今年5月,OpenAI 创始成员Andrej Karpathy 便曾在 X 上写道:人脑大约三分之一的算力用于处理视觉,视觉是信息进入大脑的十车道超高速公路;AI 输出的形态会从纯文本,到 markdown,到 HTML,最终将走向由模型直接生成的可交互视频。
在这条AI视觉交互模型赛道上,不同于纯Pixel-based式,SigmaZ AI 选择的正是**"像素代码混合式"路线**:画面仍以视频、动画或场景呈现,但背后不再只有像素,而是有一套可以被理解、修改和持续更新的内容组织方式。
目前,市面上不乏关于交互视频和世界模型的探索,但多数集中在"游戏引擎"和"机器人仿真训练"领域,服务对象是开发者和特定产业企业,离普通人的手机屏幕都较远。
SigmaZ AI 选择的服务场景是:把交互视频带进日常使用场景——做通用型平台。
这也意味着SigmaZ AI 要跨过的门槛已经从"能不能做出 Demo"升级为极度现实的工程化突破——反馈要够快、生成质量要够稳、推理成本要能撑住高频使用。

为了实现工程化突破,SigmaZ AI 团队选择从 infra 做起,它做了三个核心的技术押注。这三个押注互相咬合,共同构成了这家公司的技术壁垒,也形成了它的技术飞轮。
第一,生成媒介从"像素Pixel"转向"代码像素混合 Code-Pixel Mix"——两者分工配合。**代码 Code 负责结构、因果、交互和状态;像素 Pixel 扩散则负责纹理、细节和开放世界的高熵内容。
纯 Pixel 视频模型输出的是像素流,画面一经生成随即固化;而 SigmaZ AI 可以让模型输出可执行的前端代码,渲染之后再形成画面。交互本身即是媒介的组成部分,而非附加在视频上的外挂功能。

第二,从推理时扩展(Test-Time Scaling)到自进化:基于视觉引导递归自进化的多模态模型。
在模型层面,SigmaZ AI 可以实现自进化。扩散语言模型(DLM)长期被诟病的一个问题是单次生成的智能上限还不够高:面对复杂的视觉代码任务,模型很难一次把结构、逻辑和视觉效果同时做对。SigmaZ AI 的思路是先通过推理时扩展(Test-Time Scaling),让模型在单个任务上多思考、多试错。

第二步是训练时内化(Training-Time Internalization)。**SigmaZ AI 把这些推理过程中产生的批评、修改和最优轨迹重新变成训练信号,蒸馏回模型权重,让这一次在五轮试错中学会的东西,下一代模型可能第一轮就能做到。
最后,SigmaZ AI 也在做评审器进化(Evaluator Evolution)。**从技术维度来看,评审本身也需要被持续重训、持续进化。对此,SigmaZ AI 设计了"元评审层"的持续校准。"元评审"agent 会专门盯着评审 agent 和人类专家打分不一致的地方,自动去跑实验、重新校准评分标准,直到它和人的判断更吻合;同时,另一个"元编码"agent 会批量分析评审反馈,从中找出写代码的 agent 反复犯的系统性错误、提出改法,并在通过回测后允许上线。
以上三个循环(推理时扩展、训练时内化、评审器进化)接在一起,形成了真正的模型自进化:推理产生经验;经验沉淀为能力;不断进化的评审标准决定下一轮模型该朝哪个方向变强。
SigmaZ AI 的评审标准背后,是一个积累了数年的约 1000 人规模的按需专家网络。这些专家全部来自 QS 前 200 高校,覆盖 9 个垂直领域,75% 是硕士、25% 是博士。而且,他们不只是打分,他们更重要的作用是"校准自动评审模型"。目前,SigmaZ AI 可以实现标注者之间的一致性落在 0.67 到 0.91 之间。
这套方法由SigmaZ AI CTO Derek Law 作为核心作者写成了论文《Vision-Guided Iterative Refinement for Frontend Code Generation》,发表在 ICLR 2026 的 RSI Workshop 上。
第三,为实时生成重做模型栈:Diffusion-LM 与全栈后训练。
自回归模型代码写得很好,但问题出在速度上——它是逐 token 串行往下吐,速度约每秒 100 token。如果想要生成一个内容丰富的场景,需要好几分钟。这个速度做离线渲染是够用的,但做实时交互就是致命的短板。
SigmaZ AI 团队很早就把 DLM 系统性地用在了实时交互视频上。底座模型是市面上能买到的通用件,但围绕它构建的这套垂直整合系统,是买不到的东西——这是SigmaZ AI 真正的护城河。"post-training 只是第一步。" SigmaZ AI表示,"下一阶段,SigmaZ 会进入到 Pixel-Code joint training。Code 和 Pixel 将不再是两套彼此独立的模型能力,而是同一个世界模型表示之上的两种 decoding path。"

今年 7 月,SigmaZ AI 对内部生成引擎做了一次横向评测:覆盖 7 个主流系统、5 类真实场景、25 个具体场景共 173 段视频,独立标注者盲评产出 6,760 条人工标注。评测数据显示,在信息密集型场景里,SigmaZ AI 引擎拿到了综合质量、事实覆盖率、文字准确度三项第一,内容理解正确率并列第一,表现优于Fable 5、Seedance、Veo。

当然,对 SigmaZ AI 而言,这套 Benchmark 数据只是起点。接下来的产品发布,才是检验这家公司实力的真正考验。因此,SigmaZ 计划在2026年正式推出这套模型能力的首个产品化尝试Tap8,将其定位为"实用且有趣的实时交互内容平台"。

SigmaZ AI 最核心的壁垒,便来自团队在模型训练、视觉生成和消费级产品这三块之间的复合 Know-how。
在团队构成上,SigmaZ AI 联合创始人兼 CEO 杨博麟(William Yang)是一位2003年出生的连续创业者,拥有华威大学和剑桥大学的学术背景,曾把多个创业项目从零做到数千万营收并完成一次退出,对于将新技术落地为日常使用的产品有第一线的判断。
SigmaZ AI 联合创始人兼 CTO Derek Law 毕业于帝国理工学院计算机科学专业,他有近十年的前沿AI Lab经验,曾是 Amazon Alexa 首位华人算法研究员,负责Amazon旗舰模型从视觉代码训练到上线的技术开发。
两位创始人之外,SigmaZ AI 的核心团队还汇聚了来自 Amazon AGI、Alibaba AI Lab、ByteDance AI、Baidu 等一线实验室的资深研究员与产品负责人。
SigmaZ AI 的另一个优势在于"数据"。交互视频是一个全新的品类,行业里既没有现成的公开数据集,也没有专门的数据公司提供标注服务。过去一年,SigmaZ 在真实的生产环境中,积累了数十万条带有人类偏好标注的真实数据。
数据主要来自三个渠道:
- C端消费者产品。 在行业普遍对"用代码生成交互视频"持观望态度时,SigmaZ AI 已从去年年底开始布局,通过首款C端消费产品积累了第一批种子数据。
- B端试点合作。 方向明确后,团队与大量B端用户开展了试点合作。这些用户在真实场景和受控环境下使用产品,持续产生高质量数据。
- 合成数据。 在前两类数据基础上,SigmaZ AI 团队进一步通过合成方式实现数据规模的扩展。
这三类数据互为补充:C端数据提供真实用户反馈,B端数据覆盖结构化场景,合成数据完成规模放大。它们共同构成了SigmaZ AI 模型后训练的核心素材,也反过来驱动RSI自进化闭环的持续运转。
联合创始人兼 CEO 杨博麟表示:"今天回看每一轮媒介革命,本质上都是一项底层技术重写了一次信息的载体。印刷术长出了报纸,无线电长出了广播,视频编码加流媒体,长出了今天的短视频平台。每一次媒介革命都是底层先变,新的媒介以及那个时代最大的平台,随之生长起来"
SigmaZ AI 认为,AI 是下一个新兴媒介的底层,它真正的产物是实时交互内容。因此它以视觉为入口的下一代人机交互界面,将Diffusion-LM作为实时交互时代的一种新模型范式, 以Code作为它连接视觉世界的重要原生语言,打开一个用户和AI交互的新入口。

蓝驰早期项目AI互动内容社区Loopit完成1亿美元融资 | 蓝驰家族
蓝驰天使项目它石智航完成4.55亿美金Pre-A轮融资,打造「真干活、真量产」的机器人|蓝驰家族
蓝驰早期项目庞伯特获近2亿元A轮系列融资,用AI定义体育运动新范式|蓝驰家族

