世界模型开源潮:字节张一鸣督战,视频生成从"能生成"转向"可进入"
2026年9月,多模态领域的竞争焦点悄然切换。京东、高德、蚂蚁灵波、大晓在一周内密集开源各自的"世界模型",字节跳动的世界模型则由张一鸣亲自督战。业界判断,"可进入、可交互"正在取代"能生成一段视频",成为下一代生成式AI的主战场。世界模型不再满足于输出几秒精美的镜头,而是试图构建具备空间一致性、物理合理性与可交互性的三维环境——这对依赖场景连续性的短剧、游戏、虚拟拍摄,意义完全不同。
从"生成一段视频"到"造一个世界"
传统视频模型生成几秒clip,世界模型强调三维一致、可交互、长时序。它引入空间记忆与物理约束,让镜头切换时场景连续、物体位置稳定、光照一致。对追求"电影感"的漫剧和AI长剧而言,这意味着废片率可能从70%—80%量级大幅下探,直接压低最烫手的算力成本。一句话,视频模型回答"这一帧长什么样",世界模型回答"这个世界是否自洽"。
为什么短剧需要"世界模型"
当前AI短剧最大的痛点是角色与场景的不一致:上一镜在客厅,下一镜透视错乱;人物脸换了、衣服穿帮。问题根源在于传统视频模型是逐帧生成,没有对"世界"的全局理解。世界模型一旦成熟,角色可以在同一空间里连续行动,镜头自由调度而不破功。这对需要大量场景切换、长线叙事的AI长剧尤其关键,是把AI内容从"片段玩具"推向"成片工业"的底层变量。
开源潮背后的卡位逻辑
一周内四家齐开,释放的信号很明确:世界模型被视为比单点视频模型更底层、更通用的能力,谁先开源、先建生态,谁就掌握开发者心智。京东、高德偏重产业与地理空间场景,蚂蚁灵波背靠具身智能,大晓等创业公司则押注轻量化。开源既是技术示众,也是抢人、抢落地场景的商业动作——和当年大模型开源大战的剧本高度相似。
字节亲自下场,牌桌升级
字节世界模型由张一鸣督战,分量不同。它背靠抖音、红果的亿级分发与Seedance、即梦的模型积累,一旦世界模型成熟,字节可以从"生成短视频"跃迁到"生成可交互的沉浸式内容",把短剧从被动观看推向交互叙事。当云厂商卖模型、平台卖分发,世界模型把两者的边界搅浑——它既是生产力工具,也是下一代内容形态的底座。这场仗,才刚开头。