从「生成一个片段」到「导演一段戏」
9月11日,快手把可灵AI 3.0这套AI导演平台推向海外市场。今年2月,可灵3.0已在国发布;6月17日又追加面向快速交付的Turbo版本与Omni升级。与过去「一次出一条片段、再靠人工拼接」的路数不同,3.0把命题直接写在产品定位上:不只生成视频,而是导演一段戏。平台引入统一的Multimodal Visual Language架构,把视频、音频与图像生成整合进同一个模型。
硬指标:原生4K、60帧、单次6镜
规格层面有几条硬指标:原生4K(3840×2160)60帧输出、16位HDR色彩,且是直接生成而非低分辨率上采样——后者会在皮肤纹理、布料褶皱与液体流动上留下伪影,大屏一放就露馅。单次生成时长最高15秒,支持文生视频、图生视频与首尾帧插值三种输入。多镜头AI导演允许写一段描述镜头序列的提示,一次产出最多6个相互连贯的镜头,人物一致、转场自然、叙事连贯,不必事后剪辑拼接;系统还提供智能模式,只描述场景,由模型自行决定切点、景别与过渡。
Elements角色锁定:专治「换脸」
做AI短剧的人大多经历过同一种挫败:单条片段没问题,两条接起来人物就换了张脸。Elements机制的解法是上传最多4张参考图建立身份锁,之后在分镜里反复引用,系统在机位变化、光照切换与场景转换中维持视觉一致。锁定范围不只是面部匹配,还包括发型、服装、身体比例甚至音色——为主体绑定预设音色后,它在每个出现的镜头里沿用同一把声音。同场景三个以上角色的多角色共指也被纳入,用来支撑群像与多人对话这类此前容易崩掉的镜头。
音频与运镜一起补齐
音频端,Omni变体内置48kHz音频合成引擎,推理速度提升35%,支持实时潜空间编辑;口型同步覆盖中、英、日、韩、西五种语言并支持方言口音,同一场景最多3个说话人各自独立收音。Motion Control则给出曲线运镜、2到4个主体各自运动轨迹、手持抖动三块控制面,外加6轴镜头运动与动态笔刷。
对短剧意味着什么
对短剧生产来说,真正的意义不在参数变漂亮,而在工作流被压缩:原本分散在多次生成与剪辑台上的活,被压进一次调用。但15秒的天花板仍在,长片依旧要靠分段拼装;4K档位的算力开销也不便宜。工具把「能不能做」的门槛又往下压了一截,「做得好不好」的竞争却只会更激烈。