如果说上半年AI视频生成还在"谁更能炫技"的阶段,9月则集体转入产品迭代期。据不完全统计,自9月以来,字节即梦AI、快手可灵、生数科技Vidu、Runway、智谱清影、爱诗科技PixVerse、Pika等主流平台均完成版本更新,竞争焦点从"生成时长"细化到"主体一致性""声画同步"与"多参考输入"。
30秒成新基线
时长竞赛被重新划定。字节Seedance 2.5(7月31日发布)把单次生成从15秒提升至30秒,支持最多50个多模态参考素材,声画时序误差控制在约33毫秒(不超过1帧);阿里9月1日发布Wan3.0,实现原生30秒视频生成,统一调度视听全要素。30秒——约等于一部微短剧单集的体量——成为头部模型的入门门槛,意味着AI生成首次能在单条输出内覆盖一个完整叙事单元。
可灵3.0:All-in-One与4K
快手可灵3.0 Omni走"文/图/音/视统一工作流"路线,原生音画同步、多镜头叙事、主体一致性全面升级,支持4K分辨率(Ultra层级)、30/60fps;商业端,可灵Q2营收8.5亿元、ARR近5亿美元、企业客户近5万。Curious Refuge 2026年测试给出8.1/10综合评分、画面逼真度8.4,居行业最高。可灵用"先把创作者发票抬头站稳"证明了国产视频模型不一定每项参数都赢,但商业化落地可以最快。
Vidu-1.5与"多主体一致"
生数科技Vidu本周上线Vidu-1.5,把一致性从"单一主体"推进到"多主体整合":能理解并融合角色、物体、环境等多个概念,30秒内生成多主体一致的视频结果,率先实现视频创作的多主体一致性。Runway则推出Act-One,可把真人表情精确复刻到AI角色,支撑3D AI镜头控制。各家的迭代开始"分叉":有人攻表情迁移,有人攻多参考,有人攻实时交互(Vidu实时交互模型毫秒级响应)。
高盛看到290亿美元
高盛预计,全球AI视频生成市场规模未来五年扩大约10倍,到2030年达约290亿美元。资本与模型的双向加速,让"即梦AI凌晨三点上班"成为不少短剧公司的常态。但从业者提醒:时长、稳定性、一致性都有进步,"却还不是代际进步"——模型在变强,下游制作端仍在盈亏线附近。军备竞赛的终点,不是更长的视频,而是谁能把"判断"成本降下来。