新闻速递

北大博士世界模型初创拿下3000万美元:自研视觉符号把视频成本压到十分之一

北大博士团队获3000万美元融资,以自研视觉符号体系将视频生成成本压至主流方案十分之一,轻量化路线挑战巨头基座模型。

3000万美元落袋,估值2亿

世界模型赛道又迎来一笔早期重仓。10月8日,由北大博士领衔的世界模型初创团队完成3000万美元新一轮融资,投后估值达2亿美元,多家头部美元基金入场,资金全部投入底层架构、视频数据集与推理引擎优化。在巨头扎堆训练超大基座模型的背景下,这支精简团队走了一条差异化路线:用面向AI的视觉符号系统,替代传统文本描述来表征视频里的空间、运动与光影。

不靠自然语言,改用视觉符号

常规视频生成依赖"文本转图像、逐帧生成",长时序视频会带来极高算力消耗。该团队认为,自然语言存在表达局限,难以完整描述物体运动轨迹、光影连续变化、空间相对位置,文本到视频的转换持续产生信息损失并额外消耗算力。他们构建的视觉符号词典,专门记录视频中的动态信息,AI可直接读取符号完成场景推演与生成,省去文本翻译环节,从根上减少中间损耗。

成本量级下降的逻辑

基于这套架构,视频生成的算力开销相比主流方案压缩至十分之一。对短剧、广告、影视后期这类对成本极度敏感的行业,这一个量级的下降意味着:原本因推理费用过高而放弃的批量生成场景,有可能被重新打开。对依赖AIGC降成本的微短剧承制方,这条路线值得盯紧,因为它直接改写了单分钟内容的生产账本。

轻量化路线能否跑通商业化

当前全球世界模型形成两条路线之争:一条是海外大厂投入数十亿训练超大规模基座,靠海量算力学习物理规则;另一条就是这家团队的轻量化符号路线。前者卡多、研发贵,后者省算力但要在精度与可控性上证明自己。对剧短短关注的AI漫剧供给而言,成本结构才是决定产能的关键变量——谁能把单分钟生成价格打下来,谁就握住了下一阶段的议价权,而不只是谁的模型参数更大。

24快报
JSON抓取失败