2026年9月23日,继上月披露研发进展后,全球领先的AI视频大模型公司爱诗科技(AIsphere)正式发布全球首个具备 Scaling 能力的通用实时世界模型PixVerse R2,并向用户开放包括游戏、互动影视及数字人等多个场景体验间。
基于爱诗自研的 Omni Causal AR(全模态因果自回归)与 Real-Time Acceleration(实时加速)两层架构,通用实时世界模型第一次像大语言模型一样,拥有了一条清晰、确定、可以被验证的持续扩展路径。
爱诗科技创始人及CEO王长虎表示,随着持续Scaling(规模化扩展),PixVerse R2将从当前的创作工具,逐步发展为可随时进入、随时互动的生成式环境,最终成为下一代生成式世界pg电子模型的基础设施。

ChatGPT用Scaling Laws(规模定律)证明了“模型越大、能力越强”后,整个AI行业都在追问:这条定律是否只属于文字?
过去普遍认为,只有语言这种“离散符号”才适合规模定律,而视频是“连续高维信号”,天生难以扩展。Sora的出现打破了这一偏见,但实时世界模型领域仍面临棘手难题:要实时,模型就必须做得够小、够快,才能在一块显卡上跑出流畅的帧率;要通用,模型就必须做得够大、见识够广,才能理解各种复杂的场景和物理规律。因此,过去的技术路径往往需要在两者间取舍,几乎没有人真正走通Scaling(规模化扩展)。
爱诗科技坚信,真正可扩展的通用实时世界模型不该一直在“能力”和“速度”间二选一,应该建立一条能够将两者解耦的技术路径。只要架构设计对了,当文本、参考、声音、操作这些复杂信号都能被模型统一“理解”,实时世界模型同样可以“越大越强”。PixVerse R2即验证了这一点,“实时”和“通用”不仅可以兼得,而且实时不是“偷工减料”的妥协,而是一条可以持续变强的技术路线。
以往行业谈论Scaling(规模化扩展)时,往往只意味着参数变大。但在PixVerse R2,它发生在五个维度上:

这五个维度并非各自为战,而是在同一个模型里相互增强,最终一起转化成通用实时世界模型核心能力实实在在的提升:
长程一致性更强——角色不崩、场景不跳、物体不凭空消失,世界状态在长时间运行中保持稳定
多模态控制能力更强——文字、参考图、声音、键盘操作,都能被模型稳定地“听懂”并做出反应
所以,PixVerse R2 不只是“一个更大的模型”,它是一套可以不断扩展的世界模型系统:未来往模型、数据、任务、控制信号和时间尺度中的任何一个方向继续投入,都有机会转化为更强的世界建模能力。这是 PixVerse R2 与传统“为了实时而压缩模型”的思路最本质的区别。
在用户体验层面,本次PixVerse R2 带来最重要的改变是“言出法随”。简单来说,PixVerse R2 不仅能让虚拟世界“有记忆地活着”,还能“听懂各种语言”,并对用户的每一个动作做出符合因果关系的反应。
构建可以实时探索互动的世界。在PixVerse R2里,一个能走进去、能探索的世界可通过文字和图像生成。同时,用户可以用WASD键控制角色移动、跳跃、四处探索,还能随时换视角;用户也能直接输入Prompt下指令——换角色、加东西、改环境,想到什么就能马上实现。过程中,角色、物体和环境间还会持续产生符合空间关系和物理逻辑的互动如自然的遮挡、接触和碰撞等。
互动影游实时交互新体验。在PixVerse R2里,世界还可以随着用户的行为产生剧情。也就是说,剧情不再是预先写好的固定分支,而是由模型根据玩家输入实时推演、动态生成。基于这种“玩家即编剧”的互动,PixVerse R2让每个人都能走出属于自己的、独一无二的故事线。
实时数字人是有身份、有记忆、有反应的剧情角色。在PixVerse R2里,世界中的角色还可以实时理解并回应用户。
过去做实时世界模型的思路是“为了实时,不得不降低质量”。由于训练模型需经过“五层接力”,每一次接力原本的画质、动作表现、指令理解能力都会折损。同时,模型、数据、任务的规模越往上堆,这套流程就越容易散架,训练成本也水涨船高。
爱诗科技则创造性地将“能力”和“效率”解耦,先把基础模型能力上限持续扩大,然后通过独立的加速路径保持实时性,而不是在两者之间反复拉扯和让步。具体来说,其将PixVerse R2 的整个训练框架收敛成了两个核心引擎:
Omni Causal AR(全模态因果自回归)是“能力引擎”,它就像大脑,负责持续吸收更多数据、更多任务、更长的时间跨度,把世界模型的理解力和表现力训练到最强。
Real-Time Acceleration(实时加速)是“加速引擎”,负责把这套已经练到最强的能力,尽可能无损地压缩进严格的实时延迟约束里。
两者形成一条清晰的分工和流水线:先探索能力的上限,再把这个上限变成人人都能实时打开、实时互动的产品。
此外,围绕上述两个引擎,PixVerse R2 在工程细节上还有大量针对性设计,让Scaling(规模化扩展)的每一步都能被实时产品稳定继承。
随着PixVerse R2正式发布,视频生成技术的行业格局正在发生深刻变化。
如果把今天的生成式 AI 放在更大的技术坐标系中来看,实时世界模型正处于几个不同技术方向的交叉位。传统视频生成擅长高质量内容生成但需要等待;数字人和实时交互系统能够快速回应用户,但生成的世界通常受到预设内容和交互框架限制;传统游戏引擎能够实时运行复杂世界,但世界本身主要依赖人工构建。
实时世界模型试图连接这些能力。它既需要生成模型对世界的理解和生成能力,也需要实时系统对延迟、计算和长期运行的控制能力。因此 PixVerse R2 的核心价值不只是占据一个坐标,而是改变其背后的关系,让能力和速度成为可以分别持续提升的两个维度。这一架构层面的创新为实时世界模型的发展开辟了一条可预期、可复现、可持续投入的技术路径。
目前,PixVerse R2 仍处于发展初期,存在明确的局限。在严格的实时计算和交互延迟约束下,其单次生成质量与前沿离线视频生成模型相比仍有提升空间。但其底层架构与技术路径已经过验证,具备持续迭代和演进的坚实基础。以PixVerse R2 为起点,爱诗科技将在模型、数据、任务、控制信号、时间尺度五个维度加大投入,推动R系列模型能力的持续增强。
王长虎表示,实时互动视频生成不是世界模型的全部,但它是世界模型最早能被大众感知、最接近产品化、也最容易产生新体验的一条路线。未来,实时世界模型将分阶段演进:从当前的创作工具,逐步发展为可随时进入、随时互动的生成式环境,最终成为下一代生成式世界模型的底座与基础设施。
1.凡本网站注明“来源:中国网财经”的所有作品,均为本网合法拥有版权或有权使用的作品。
2.未经本网授权不得转载、摘编或利用其它方式使用上述作品。已经本网授权使用作品的,应在授权范围内使用,并注明“来源及作者”。违反上述声明者,本网将追究其相关法律责任。
中国网是国务院新闻办公室领导,中国外文出版发行事业局管理的国家重点新闻网站。本网通过10个语种11个文版,24小时对外发布信息,是中国进行国际传播、信息交流的重要窗口。