Runway GWM Worlds 2 实时交互世界模型发布,游戏与影视的生产逻辑要变了

Runway GWM Worlds 2 实时交互世界模型发布,游戏与影视的生产逻辑要变了

假设你是一个独立游戏开发者。你脑子里有一个完整的世界:北方的雪原、南方的沙漠集市、一座被藤蔓吞没的废弃城堡。你能清楚地描述每一处光线、每一种环境音、每一个 NPC 的性格。但你打开 Unreal Engine,面对的是几个月的场景建模、材质绘制、光照烘焙、动画绑定和音效制作。

或者你是一位影视概念设计师。导演说”我想看看角色在暴风雨中穿过一条中世纪街道是什么感觉”,你的选择是花三天画一组概念图,或者花两周搭一个预可视化场景。无论哪种,导演看到的都是静态的、不可交互的。他没法自己走进去感受空间,没法随手把暴风雨换成晨雾看看效果。

这两个场景有一个共同的瓶颈:从”脑子里的世界”到”可以体验的世界”,中间隔着巨大的工程量。而近日 Runway 发布的 GWM Worlds 2 正在试图把这段距离压缩到接近于零。

不是”生成一段视频”,而是”生成一个世界”

过去两年,AI 视频生成工具爆发式增长。从 Runway 自己的 Gen 系列到 Sora,这类工具的核心逻辑是一样的:你写一段描述,AI 给你一段视频。十秒、三十秒、一分钟,时长在增长,画质在提升,但本质没变,你得到的是一段“播完就结束”的固定片段。你没法在视频播放到一半时说”让摄像机往左转”,更没法说”让那个角色拿起桌上的杯子”。

GWM Worlds 2 做的事情,和这个逻辑完全不同。

Runway 称它为”世界模型”(World Model),而不是”视频生成模型”。区别在哪里?视频生成模型的输出是一条时间线上的像素序列,生成完毕就定型了。世界模型的输出是一个持续运行的环境。它不会自己“播完”,而是一直等着你的下一个输入。你可以在里面移动、改变视角、让角色做动作、改变天气、点燃一堆篝火,世界会根据你的操作实时继续往下演。

用一个更直观的比喻:AI 视频生成像是你点了一道菜,厨房做好端上来,你只能看和吃;世界模型像是你走进了厨房,食材和灶台都在,你可以随时决定接下来煮什么。

这个”世界”到底能做什么

Runway 在官方研究页面展示的演示场景是一片沙漠求生世界。同一个世界被三种方式使用:

第一种是玩家视角。一个角色以第一人称在沙漠里移动,走路、用长矛刺击、从水壶里喝水、突然开始奔跑。所有这些都是实时生成的,不是预先渲染的动画。

第二种是导演视角。操作者不控制角色,而是控制场景本身,对着篝火下达指令让它燃烧得更旺,对着天空说“日落淡去,变成星空”。环境就随之改变。

第三种是两者同时进行。一个玩家在沙漠中控制角色走路、战斗,同一时间一个导演在同一个世界里实时改变光照和天气。两个人操作的是同一个生成中的世界。

从技术参数上看,GWM Worlds 2 实时输出 720p 分辨率、24 帧每秒的连续视频,同时生成 48000 Hz 的同步音频,包括环境声、音效甚至角色对话的语音和口型。这里的关键词是”同步生成”:音频不是事后配上去的独立轨道,而是和画面在同一个生成流程里一起产出的。角色说话时,口型、语气、音色都是模型在生成画面的同时一并生成的。

还有一点更关键:会话没有预设时长。传统 AI 视频有一个固定的片段长度,生成完就结束了。GWM Worlds 2 使用滑动窗口注意力机制,理论上可以无限期地持续生成,只要用户还在交互,世界就不会停。

一种叫 WorldPrompt 的新控制方式

让这一切成为可能的,是 Runway 设计的一套输入格式,叫做 WorldPrompt。

传统 AI 视频生成的输入就是一段文字描述,顶多加一张参考图。WorldPrompt 把输入拆成了两层。

第一层是持久世界上下文,相当于世界的“宪法”。它包含一段创世描述(genesis prompt),定义环境的布局、材质、光照、环境音;定义世界中的角色及其属性;定义”法则”(laws),比如重力行为、碰撞规则、镜头跟随逻辑。再加上一张第一帧图像,作为视觉锚点。

第二层是带时间戳的事件流。每一个动作都是一段自由文本,标注了开始和结束时间,可以寻址到某个角色或场景本身。多个动作可以重叠。摄像机输入则是逐帧的平移和旋转数据。

Runway 在官方页面展示了一个具体的 WorldPrompt 示例:一条雨后的城市街道,一个穿橙色背心的清洁工和一个穿绿色风衣的女人交谈。场景描述了砖墙建筑、湿沥青路面、黄色落叶。角色各自有外貌、声音、位置的定义。然后时间线上,对话和动作交错展开,清洁工一边扫叶子一边指路,女人边走边说谢谢。

这种分离设计的意义在于:世界的”骨架”是稳定的,而事件是可以即兴发生的。你不需要每次交互都重新描述整个世界,只需要往事件流里扔新动作就行。这让实时交互成为可能,也让多人同时操作同一个世界成为可能。

为什么这和游戏引擎不是一回事

读到这里,一个自然的疑问是:这听起来不就是游戏引擎做的事情吗?Unity 和 Unreal 不也是实时生成可交互的环境吗?

区别是根本性的。

游戏引擎需要美术资产。每一栋建筑、每一棵树、每一个角色的模型、贴图、动画骨骼、物理碰撞体,都需要人先做出来,然后引擎才能渲染和模拟。你想让一个角色”拿起桌上的杯子”,你需要杯子的 3D 模型、抓取动画、物理交互逻辑、音效文件,每一个都是独立的工程环节。一个 3A 游戏的开放世界,背后是几百人几年的资产生产。

世界模型不需要这些。你用文字描述世界和角色,模型直接生成画面和声音。”角色拿起杯子”这个动作,是模型在理解文本指令后,在像素层面和音频层面直接生成出来的,没有 3D 模型,没有预制动画,没有物理引擎在背后计算碰撞。

这意味着什么?意味着创建一个可交互环境的门槛,从”需要一个团队和几个月”变成了”需要一段文字描述和几秒钟”。Runway 在演示中展示了一个功能叫”世界创作”(World Authoring):用户输入一句简单的描述,比如”第三人称视角,雪地里的越野摩托”,一个 LLM 就能自动生成完整的创世描述、第一帧图像和一套绑定到键盘按键的动作集。从一个想法到一个可以进入的世界,整个过程只需要几秒钟。

当然,代价也很明显:世界模型生成的环境在视觉保真度、物理一致性和长期记忆上,还远远达不到传统游戏引擎的水准。Runway 自己在研究页面的局限性章节里也直说了:快速旋转摄像机时画面细节会退化,长期记忆不完美,不支持第一帧之外的图像参考。这不是一个可以替代 Unreal Engine 做 3A 游戏的东西,至少现在还不是。

但它打开的可能性空间,和传统引擎完全不在同一个维度上。

影视预可视化可能是最先被改变的环节

回到文章开头那个影视概念设计师的困境。导演想看”暴风雨中的中世纪街道”,传统流程是画概念图或搭预可视化场景,周期以天和周计。

世界模型提供了一种全新的工作方式。导演可以用文字描述场景,几秒钟内得到一个可以进入的环境,自己在里面走动、调整视角、随口说”把暴风雨换成晨雾”,世界实时响应。这不是最终画面,但它是一种前所未有的快速验证手段。导演第一次可以在动手制作之前,就亲身”走进”自己想象的场景里感受空间、节奏和氛围。

Runway 设计的三种使用模式也印证了这个方向。除了实时交互模式(适合游戏),还有一种”预先编排”模式(ahead of time):用户先写好完整的时间线,把每个动作、每句对话、每个镜头运动都排好,然后模型一次性生成整段视频和音频。这本质上就是在用 AI 做分镜和预可视化,只不过输出的不是静态画面,而是带声音的完整影像。

还有一种”回合制”模式(turn-based):生成运行到某个节点暂停,等待用户做出选择,再继续。这种模式天然适合互动叙事和视觉小说。

三种模式、同一个模型,这意味着同一套技术,可以同时服务于影视制作、游戏开发和互动内容创作。过去这三个行业用完全不同的工具链和生产流程,而世界模型有可能把它们拉到同一个底层基础设施上。

多人协作和 AI 代理:更远的可能性

GWM Worlds 2 还展示了两个值得关注的方向。

一个是多人模式。在演示中,不同用户可以扮演不同角色,玩家 1、玩家 2、导演,通过 LiveKit 实时广播视频和音频给所有连接的客户端。每个人选择不同的角色,在同一个 AI 生成的世界里同时操作。这不是分别生成再拼合,而是多个输入源共同驱动同一个持续生成的世界流。

另一个是 AI 代理控制。Runway 展示了用 AI 代理代替人类来操控世界中的角色。在一个简单的测试里,模型生成了一个有机器人和两面旗帜的世界,AI 代理被指令”走到红旗那里”,它自主选择移动动作,第一次尝试就完成了任务。这指向的是具身智能(embodied AI)和机器人训练的方向:在 AI 生成的虚拟环境中训练 AI 代理,而不需要搭建真实的物理测试场。

这个方向上,Runway 并不是唯一的参与者。Google DeepMind 的 Genie 3、World Labs 的 Atlas、NVIDIA 的 Cosmos 世界模型,都在探索类似的技术路线。从公开信息来看,这些系统在分辨率和帧率上已经趋于接近,都在 720p、20-24 帧左右。真正的差异化竞争不在参数表上,而在谁能更快地让开发者真正用起来。

而目前,GWM Worlds 2 还只是研究预览阶段,没有公开 API,没有定价,只能通过联系表单申请体验。这意味着它展示的是一种方向和可能性,而不是一个今天就能投入生产的工具。

生产逻辑的变化才是核心

技术参数会继续进步,分辨率会从 720p 涨到 1080p 再到 4K,帧率会更高,画面一致性会更好。这些是可以预期的工程推进。但 GWM Worlds 2 真正值得关注的,不是某个具体的参数指标,而是它揭示的一种生产逻辑转变。

过去几十年,创建可交互的虚拟环境是一项重资产、高门槛的工程,需要专业团队、专业工具、大量时间和资金。这个门槛决定了谁能创造互动体验:大型游戏工作室、有预算的影视制片方、有技术团队的科技公司。

世界模型的方向是把这个门槛降到”能用自然语言描述想象”的程度。这不意味着传统引擎和制作管线会消失(就像摄影没有消灭绘画),但它意味着”从想法到可体验的交互环境”这条路径上,会出现一条全新的快速通道。

Runway 自己在研究页面的结尾用了一个类比:他们预期实时视频生成会经历和离线视频生成相同的进化曲线,从粗糙的短片段到高保真的制作级产出。GWM Worlds 1 和 GWM Worlds 2 是这条曲线上的两个早期点。

对于游戏开发者、影视创作者、互动内容设计师来说,现在需要关注的不是”这个工具今天能不能用”,而是”当这个方向在两三年内成熟到可用程度时,我的工作流程会变成什么样”。

因为到那个时候,瓶颈将不再是”你能不能建造一个世界”,而是”你能不能想象出一个值得进入的世界”。创造力本身,会重新成为最稀缺的资源。

延伸阅读

查看完整选型指南 →

Stay updated with our latest AI insights

Follow FuturePicker on Google
滚动至顶部