世界模型已经被讲得足够宏大。
它可以指向游戏、机器人、自动驾驶、具身智能,也可以被放进很多关于 AGI 和物理世界理解的远景叙事里。但对一家视频模型公司来说,一个更现实的问题是:在这些远景真正到来之前,世界模型能为用户做什么?
即将发布的 PixVerse R2,给出的答案是:用世界模型重构互动娱乐。
今年 1 月发布的首个实时世界模型PixVerse R1,已经完成了第一步:它把 AI 视频从一次性生成的固定片段,推进为一条可以连续运行、实时响应用户输入的视频世界。随后,Avatar、Shared Worlds 和 PixVerse Game Engine 的更新,又让用户开始以角色身份进入生成世界,并把实时生成、多人输入、AI Agent 和结构化游戏机制连接起来。
这可能也是爱诗科技想通过 PixVerse R2 传递的信号:世界模型不只需要被讨论,也需要先找到一个能被用户进入、互动和反复使用的地方。互动娱乐,就是它目前给出的答案。当世界模型进入互动娱乐场景,它能不能让游戏、直播、影视这些内容形态,从预制内容走向实时生成、实时参与和动态反馈?
从目前R2的几组demo中,我们发现R2 并不是把互动娱乐当作一个抽象概念,而是在尝试把世界模型放进更具体的场景里,或许也是世界模型里普通用户最近的一次。
第一部分:让用户从“看”到“玩”
过去半年,PixVerse 的几次更新其实都在同一条路线上:让生成内容从“可以观看”,一步步变成“可以进入、可以参与、可以被规则驱动”。今年 1 月发布的 R1,先把视频生成推进成一条可以连续运行、实时响应用户输入的视频流;
随后,Avatar 和 Shared Worlds 让用户可以以角色身份进入生成世界,并与他人共同参与同一个持续运行的内容;到 7 月的 PixVerse Game Engine,实时世界模型又被进一步接入 AI Agent、目标、规则和状态变化这些游戏机制。
R2 不是突然转向互动娱乐,更准确地说,它是 PixVerse 过去半年持续尝试之后的一个结果:R1 让内容实时运行,Avatar 和 Shared Worlds 让用户进入世界,Game Engine 让世界开始具备玩法结构,而即将发布的 R2,则开始把这些能力推向更具体的互动娱乐场景。
从R2的demo视频来看,目前主要落地在游戏、影视,以及直播/虚拟角色等可商业化的场景里。
画面里,用户通过 WASD 和方向键控制角色,在街巷、通道和建筑之间移动、转向,并靠近环境中的交互节点。视频中出现了类似“秘密路线”的提示,角色接近后,场景继续展开。
这段视频里,R2展示了世界模型进入游戏场景时最基础的一层能力:操作反馈。用户往前走、转向、靠近某个目标,世界都要即时响应这些动作,并在下一刻给出反馈。
如果这类能力继续成熟,游戏里的部分空间、路线、环境节点和局部事件,就不一定都要提前制作完成,而可以在用户行动中动态生成。R2 在游戏方向上的想象,不是生成一段游戏感视频,而是生成一个可以被操作的世界。
而在互动游戏的基础上,就产生了新的互动视频,也可以被称之为互动影游。视频里,角色骑乘进入一个武侠/奇幻场景,穿过街道、台阶和雾气,来到一个选择节点。用户可以随时写提示词影响剧情,比如“出现一只老虎坐骑”、“选择你的武器”等等,随后选择引出不同的视觉演出和战斗反馈。
过去很多互动影视,本质上是在几个提前制作好的分支片段之间切换。R2 想展示的可能性是,用户的选择不只是触发某个固定分支,而是进入下一段画面、动作和事件的生成过程。
这意味着,影视内容的互动边界可能被重新打开。观众不只是观看故事,也不是简单点击结局,而是开始影响影像接下来如何发生。
如果把互动影视再推向实时响应,就是直播场景了秒级回复。视频里,三星堆风格的青铜面具形象出现在展陈空间中,以角色身份进行讲解和回应。它不靠移动、战斗或分支选择建立互动,而是通过语音、表情、场景氛围和角色感,把用户带进一个具体语境。
这对应的是直播、文旅导览、虚拟主播、IP 角色运营和陪伴型内容。过去数字人直播高度依赖脚本和预设表现,而世界模型要打开的,是角色在具体场景中持续表达、回应和变化的可能。
过去,互动娱乐的核心内容大多需要被提前制作好。地图、分支、角色表演、直播话术、视觉演出,都由创作者或开发者预先设计,再在用户操作时被触发。
这也是世界模型从“看”到“玩”的真正含义。AI 生成内容不再只是给用户一个观看结果,而是开始把用户的操作、选择和对话接进内容本身。它不一定已经是一个成熟的游戏、影视或直播产品,但它已经指向了互动娱乐下一步最重要的变化:内容开始在用户参与中发生。
第二部分:世界模型能不能Scaling?
如果说 R1 证明了实时世界模型可以成立,那么 R2 要回答的是另一个问题:这样的世界模型,能不能持续 scaling?
这不是简单把视频生成得更长,也不是把更多功能模块拼到一起。实时世界模型真正难的地方在于,它要同时处理画面、声音、文本、参考内容、动作控制和用户交互,还要在持续运行中保持稳定。如果每一种能力都依赖独立模型和独立训练阶段,系统越复杂,能力迁移和体验割裂的问题就越明显。
这和普通视频生成不同。视频生成通常是一次性任务:输入 prompt,等待结果。但互动娱乐的场景里,用户会移动、选择、说话、打断、改变方向,系统必须在这些输入发生时继续生成内容。模型面对的不再是一个静态指令,而是一个不断变化的过程。
所以 R2 的框架被收敛成两层:Omni Causal AR 和 Real-Time Acceleration。前者负责扩展世界生成和演化能力,后者负责把这种能力加速到低延迟、可交互的体验里。简单说,就是先让模型学会长期运行一个世界,再让这个世界以足够快的速度被用户体验到。
其中一个关键点是 Dynamic Chunk。不同互动方式有不同节奏:文字 prompt 可能描述一个完整事件,语音包含语义和节奏,Action 操作则需要更快反馈。R2 用动态 Chunk 适配这些时间尺度,让动作可以更快响应,也让更长的事件保持完整表达。
放到互动娱乐里,这就是最基础的体验要求:游戏里的移动要立刻反馈,互动影视里的选择要影响接下来一段演出,虚拟角色的语音、表情和语气也要同步。R2 要做的,是让这些不同输入进入同一个世界生成过程。
但 R2 的意义不只在技术本身。世界模型现在最需要的,是找到一个真实场景。
今天很多关于世界模型的讨论,还停留在远景里。它当然可以指向机器人、自动驾驶、具身智能和更复杂的物理世界理解,但这些场景对稳定性、确定性和安全性的要求都很高。对还在早期的世界模型来说,直接进入这些场景并不现实。
互动娱乐的价值在于它不是世界模型的终点,但可能是早期最合适的训练场和落地点。游戏、互动影视、虚拟角色、直播、文旅导览,都是用户能理解、能体验、也愿意尝试的场景。更重要的是,用户在这里会不断移动、选择、提问、打断、重试,这些行为会产生世界模型最缺的交互数据。
过去的视频模型主要学习成片内容,但世界模型需要的是人在动态环境里的交互轨迹:用户如何表达意图,系统怎样反馈才自然,什么样的变化会让人觉得这是真实的世界。
因此,R2 把世界模型放进互动娱乐,不只是寻找商业化场景,也是在建立一个数据飞轮:用户进入体验,产生操作、选择和对话;这些数据反过来帮助模型理解交互、场景和世界运行逻辑;模型体验提升后,又吸引更多用户进入。
在技术还没有完全成熟时,早期应用往往不是先进入最严肃的场景,而是先在聊天、娱乐、情感陪伴这些更开放、更高频的 C 端场景中被用户使用。世界模型可能也会经历类似阶段。
在真正完整的世界模型到来之前,爱诗科技认为,互动娱乐可能会先成为它最重要的现实入口。




0 条评论
请「登录」后评论