世界模型混战 7 个月,PixVerse 打出第二张牌
召唤老虎、伪装成巡逻兵、和三星堆青铜器唠四川话。
召唤老虎、伪装成巡逻兵、和三星堆青铜器唠四川话。

👦🏻 作者: GaKi
🥷 编辑: Koji
🧑🎨 排版: NCon

据 Dealroom,2026 年上半年,世界模型赛道全球融资已经超过 30 亿美元。
根据 IT 桔子的统计,7 个月之内中国新成立了 23 家世界模型公司,超过 2025 年全年,融资总额超过人民币 40 亿元。
在这个节点上,爱诗科技(PixVerse) 正式发布了 R2 ,一个实时视频世界模型。
它的上一代 R1 发布时,我们在 24 小时内做了实测,这是 PixVerse 在该类目推出的首个可玩模型版本,印象最深的一点是,画面在持续生成的过程中可以被用户的输入实时改变。
R2 延续了这套实时底座,升级在于输入的影响不再停留在当下这一帧画面,会进入正在运行的内容状态。
🚥 接下来分享我们对 PixVerse R2 以及背后 PixVerse 下场做世界模型这件事的观察与思考。
从 R1 到 R2,什么变了、什么没有变?
回顾 R1 这条产品线的推进节奏,会更容易理解 R2 的产品定位。
2026 年 1 月,R1 发布了,它提出了「实时视频世界模型」这个范式:
🚦 视频生成是一个持续运行的世界演化过程,模型在运行中持续接收用户输入、实时更新世界状态,连续输出与交互一致的音视频内容。用户看到的画面可以被实时影响,并与用户共同演化。
从 1 月到 7 月,R1 加入了个性化的 Avatar、Shared Worlds 和多人共同输入,PixVerse Game Engine 也发布了。实时世界模型、AI Agent 与结构化游戏机制被连接了起来,玩法也更多了。
我们此前实测过基于它的 PixVerse Game。
当时的判断是,画面还比较早期,但游戏要素的完整度已经有了基础。同时,官方也把它定位为早期研究阶段的系统。
R2 这个产品则在这条线的延长线上。
大致来讲,相比于 R1,R2 关注 4 个重点:
【1】画面的变化能否被后续内容记住;
【2】故事能否在变化后继续;
【3】角色是否可以保持身份与关系;
【4】任务是否能形成明确结果。
实时、互动、虚拟数字人
这回,官方给出了三类 Demo ,分别对应 R2 的三个产品方向:
实时生成游戏 —— 内容可以形成玩法
在第一类 Demo 中,信使手持货物躲避追兵,用户可以通过 WASD 键和空格键实时控制其移动与跳跃。
被追捕的同时,如果在下方输入「用障碍物阻拦士兵」等提示词,画面便会即时生成对应障碍并改变局势,直接把生成内容转化为即时玩法机制。

更直观的是,当控制信使躲在角落时,只要输入提示词,就能直接伪装成巡逻兵。
互动影视 —— 故事可以被参与
第二个 Demo 是古风场景。同样通过输入提示词(如「召唤老虎坐骑」),主角便能直接与生成物交互,比如骑上老虎。
进入下一关卡时,画面会弹出选项供玩家选择武器,呈现出类似互动影游的玩法。
实时虚拟人 —— 角色可以持续存在
官方还展示了另一类实时虚拟人 Demo:玩家在下方输入文本对话,画面中的主体会实时响应。
比如问它「你真的是三星堆外星人吗」,青铜器便会即时活化为虚拟数字人并用四川话开口交流。
更关键的是它具备上下文记忆。后续追问「眼睛为什么这么大」时,数字人的回答能承接前文,维持了完整的对话连贯性。
技术报告解读:先做强,再做快
这份技术报告的关键词是 Scaling,也就是怎么让模型持续变强。
在报告里,团队展示了他们的思路:
R1 证明了实时视频世界模型这条路基本走得通,R2 则要在此基础上加入更多数据、更多算力、更多种类的输入,验证模型能不能随之稳定变强。
整个 PipeLine 大致可以分为为 2 层。
【1】Omni Causal AR,负责把模型能力做大。
【2】Real-Time Acceleration,负责把做大的能力加速到实时交互的延迟要求里,尽量不「丢包」。

多阶段压缩不是可扩展的路径
这份报告在讲解他们解决方案的同时,也透露了行业里一些通行做法。比如,想做一个又快又好的实时生成模型,通常要经过好几个训练阶段:
先训练一个质量很高、但反应慢、延迟高的大模型,再一步一步压缩,做成反应快速的小模型。

问题出在这条路线的起点。传统做法从一个双向视频基模继承而来,世界模型的底座(也就是 Omni Causal AR 这一层)还没有打好,就直接进入多个 stage 的调参,一步步把生成步数压到实时模型的水平。
等到进了实时阶段,再花大量时间微调效果。
每经过一个 stage,上一步训练出来的画质和动作表现都可能丢失一部分,阶段越多丢失越多,训练成本也越高。更关键的是,实时阶段的微调只能修补当下这一版模型的表现,底座的能力并不会因此增长。
数据和算力加上去,模型也不会随之持续变强,这条路线不具备可扩展的进化路径。
所以 R2 的整体思路是把训练收敛到两个阶段。
第一阶段用训练双向视频大模型同等的 Scaling 规模,去训练世界模型底座,先把能力做足。
第二阶段在一个能力足够强的大世界模型上做实时加速,而在这一阶段 PixVerse 在之前的系列中就已经有了比较多的积累。
具体该怎么做,分为两层,下面分层展开。
第一层:怎么让一个长期运行的「世界」不崩掉
在这一层里,模型统一接收多种输入,包括文字、图片或视频、游戏手柄和 WASD 操作,还有声音,输出是画面和声音同步的视频流。它运行的时候你随时输入,模型就能随时改变接下来的走向。
让模型光生成下一段画面并不困难,困难的是画面一段接一段生成下去之后,还要保持在同一个「世界」逻辑之下。
具体的表现是,游玩过程中每生成一个画面,角色和场景的一致性都要保持住。而且模型的输出需要具有记忆,你 10 分钟之前执行过的操作,10 分钟之后模型不能忘掉。
但这一点在实时视频世界模型里非常难做,PixVerse 在技术报告中也承认了。
不过,围绕这个问题,R2 做了几件事,提供了一个很好的解决思路。
【1】按输入的性质切分时间
不同的输入,像文字、画面、操作、声音,需要的模型反应速度差别非常大。比如按 WASD 方向键和输入一段剧情描述文字,需要展开的时间完全不一样。以前的做法是所有输入按同一个固定节奏处理,快的得等慢的。
R2 改成看输入是什么,就把时间切分成多长。简单来说,操作类的输入切得会非常短,让模型反应更快;剧情类的输入切得更长,把内容讲得更完整。
【2】故意用「有偏差的历史」训练
模型在训练时看到的历史画面都是干净、标准的。
但真正运行起来,模型生成新画面时要回溯之前的历史画面,如果回溯到的是带瑕疵的历史,又没有针对性的训练方法,后面的生成就会出问题,很可能一路错下去。
所以 R2 在训练时把两种画面都作为素材 —— 有瑕疵的和没有瑕疵的。干净的历史画面让模型保持质量上限,带瑕疵的历史画面让它提前适应真实运行的状态。
这样,即使前面的画面出了点问题,后面的画面也能继续稳定生成。
效果很明显,衡量长期画面跑偏的一项指标从 0.201 降到 0.129,降了大约 35.8%。
【3】把记忆分成三层
如果把全部历史画面都记录下来,算力和显存成本非常高。但记忆点少了,模型生成时角色和世界设定的一致性又容易丢失。
所以 R2 把记忆做了分工,一共分为三层。
第一层专门保存最不能丢失的记忆,比如角色的长相、场景的设定、世界的规则。第二层关注最近新生成的动作和镜头变化。第三层保存重要物体的状态。
这样就把长期记忆和滚动更新区分开了,前面我们所说的 R2 能让角色保持身份一致性,就是这套记忆分工的作用。
第二层:实时加速,而不是不重新学习
除了第一层为了不让整个世界崩坏所做的架构设计之外,「实时加速层」这一层还有工程上的一些行动。
大尺寸的模型虽然能力强,但反应速度会非常慢。而实时视频世界模型对交互速度的要求恰恰非常高。「加速」因此成为业内的常见做法,传统路径是让小模型跟着大模型学习,由大模型教导小模型。

但 R2 在这里有一个关键设计 —— 老师和学生用的是同一个底层基础,都来自第一层练好的大模型,这样小模型从一开始就知道整个世界该怎么运转。
「加速」过程要解决的,就只剩怎么用更少的计算步数,得到更接近大模型的效果。
具体的加速手段有三个。
【1】把指令遵循能力和画面真实感这些训练目标分开处理,再进行合并,避免互相拖后腿。
【2】让模型少看没用的信息。
模型生成每一段新画面时,需要回头查看之前所有的画面信息,但其中大部分和当前这一段关系不大。所以 R2 只让模型查询最相关的一部分,9 成以上的查看操作都省掉了。据团队所说,效果基本没有损失。
【3】生成画面时,先用低分辨率把场景布局和运动定下来,再用很少的计算步数补充高分辨率细节,省掉大量重复计算。
所以整体来看,可以做一个简单的总结。
R2 的顺序是先做强再做快,在这条路线上,它做了很多记忆分层、错误收集方面的工程化工作,尽量让整个模型在实时生成世界的过程中不崩坏。
不过官方也在 Limitations 里提到,在实时延迟要求下,R2 单次生成的质量和最好的离线视频模型相比还有差距,尤其是复杂场景细节、动作自然程度和物理一致性。
同时官方也提到,差距来自当前的训练规模,框架本身的上限还没有到。随着数据和算力持续投入,通过 Scaling,差距会持续缩小。
这样一看,R2 技术路线下的下一个模型会很值得期待。
世界模型之后
围绕世界模型,技术路线已经出现了明显的分化。
李飞飞在 2026 年 6 月 3 日发表于其 Substack 的文章中提出了一套功能分类法,把所有自称世界模型的系统按输出分成三类:渲染器、模拟器、规划器。

按商业路线看,也有两条主线。
一条是「世界模型即产品」,像是 World Labs 把 Marble 卖给创作者。
另一条是「世界模型作训练基座、智能体作产品」,General Intuition 明确表态不卖模型,agents 才是产品,Embo 做机器人世界模型也属于这条路线。
但整个世界模型的定义仍然没有收敛,很多路线之间互不兼容。
在这个背景下,做 AI 视频模型的公司天然会成为热门,简单来说,这里面有 3 层原因。
【1】 技术上具有连续性,视频模型在训练过程中已经在隐式地学习物理世界的规律。
【2】世界模型需要海量的视频数据和真实的交互信号,视频公司恰好两样都有。
【3】AI 视频是 Coding 之外,AI 行业里另一条获得了真实商业验证的路径。
所以在世界模型这个还没有收敛的赛道里,PixVerse 的站位是清楚的 —— 实时交互世界模型这条路线的主要推进者。
爱诗科技(PixVerse) R1 确立范式,R2 验证 Scaling 成立。
叠加上「本身有用户、有收入的头部视频模型公司」下场做世界模型这件事,它们的产品迭代将是这个赛道里最值得持续关注的动向之一。ps: PixVerse R2 的预约链接如下:https://aisphere.feishu.cn/share/base/form/shrcnjw9Co12dji5ZtvH18YOakf。想要尽快体验的,可速速填写。

