同一周,两家把同一个数字翻了一倍。
8 月 7 日,阿里的 Wan3.0 开启公测,在千问创作平台开放体验,单次最长生成 30 秒视频,官方主打一镜到底、多段连续运镜这类复杂镜头语言,强调角色、道具、场景的高一致性。
8 月 8 日,字节的 Seedance 2.5 同步登陆 Runway、Krea 和火山引擎 API,单次生成时长从 15 秒提升到 30 秒,一次支持最多 50 个角色参考,兼容十余种语言。
两家给出的说法几乎是同一句话。阿里的官方表述是,AI 视频从生成一个镜头走向讲述一段完整的故事。
这个数字之所以值得单独写一篇,是因为 30 秒恰好卡在一个分界线上:它是一个镜头的上限,也是一段叙事的下限。
一、30 秒之前,你拿到的只是素材
先说清楚为什么 15 秒不够用。
一段 15 秒的视频,放在成片里通常是一个镜头。你要做一条完整的短片,得生成十几段再拼起来。而拼接正是老问题的来源:这一段里主角穿的是深色外套,下一段变成了浅色;这个场景的光线是傍晚,切过去成了正午;人物的脸在镜头之间轻微地漂移。
行业里管这叫角色漂移和场景跳变,它是 AI 视频至今没能大规模进入正经内容生产的主要原因。不是画面不好看,是接不上。
所以时长翻倍带来的不只是能生成更长的片段。Wan3.0 官方描述里那句减少短片段反复拼接带来的画面跳变和叙事割裂,说的就是这件事:每减少一次拼接,就少一处露馅的地方。
30 秒能装下什么?一个有起承转合的完整场景,一段能讲清楚一件事的解说,一条完整的产品演示。它仍然不够长到拍一部片子,但足够长到不必再靠拼。
二、30 秒背后,是一致性问题攻克
单纯把时长拉长在技术上不难,难的是长时间保持不崩。
这也是为什么两家在宣传时都把一致性放在时长旁边。Wan3.0 强调人物千人千面、写实与一致性显著提升;Seedance 2.5 给出的是 50 个角色参考这个数字。
50 这个数字比 30 秒更值得琢磨。一条 30 秒的视频里放不下 50 个角色,它的用途显然不是单条视频,而是跨条目的一致性:你把一个系列里所有出场角色的参考图都喂进去,让它在不同集数、不同镜头里保持同一批人长得一样。
这指向的不是单条创作,是剧集化生产。
之前我写过昆仑万维的短剧工作台,三部 AI 短剧上线七天各自做到百万美元级营收,那篇里的核心判断是:AI 内容跑通商业化靠的不是模型变强一档,是产品把随机抽卡改造成了可控工序。现在模型这一侧也追上来了:工序化生产需要的一致性,开始由模型直接提供,而不是全靠外部流程去兜。

三、30 秒能接的活,和还接不住的活
给内容方向的读者一个更直接的判断。
现在能接住的:单场景的完整叙事。产品演示、知识科普的一个知识点、品牌短片里的一个段落、社交平台上的完整创意视频。这类活儿的共同点是三十秒能讲完一件事,且不需要跨镜头的复杂调度。
再加上短剧这种题材,本身就靠强节奏和短单元支撑,30 秒一条的可控生成足以支撑起流水线。
还接不住的:长片叙事。三十秒解决了段落内的连贯,没有解决段落之间的调度。一部十分钟的片子需要二十段,段与段之间的衔接、节奏、情绪推进,这些仍然要靠人来编排,或者靠外部的分镜工具去管。
也就是说,模型解决的是这一段拍得住,而这一段接下来该拍什么,仍然是人的活儿。
还有一类需要谨慎:涉及真实人物、真实品牌、真实事件的内容。一致性提高意味着伪造成本降低,欧盟的 AI 透明度规则已经在 8 月生效,深度伪造内容必须加机器可识别的标识,国内的合规要求也在收紧。这一条对做出海内容的团队是硬约束。
四、30 秒之后,比什么
最后说说这轮竞争接下来的看点。
时长这个指标很快会失去区分度。两家已经同时站上 30 秒,下一步大概率是 60 秒、90 秒,参数上的追赶从来不难。
真正拉开差距的会是另外三件事:一致性能撑多久,也就是跨条目、跨集数还能不能保持同一批角色;可控性有多细,能不能精确指定镜头运动、时间戳编辑、局部修改而不重生成;单位成本降到多少,Wan3.0 主打的超高性价比说明价格战已经开打,而内容生产是按条计价的生意,成本直接决定了能不能规模化。
对创作者的实操建议很简单:现在值得把工作流从拼接思路改成整段思路。以前的习惯是生成一堆碎片再想办法接起来,接下来应该先想清楚这三十秒要讲什么,一次生成到位。
从生成一个镜头到讲述一段故事,这句话两家都在说。
但它真正的含义是:AI 视频的评价标准,从好不好看变成了这能不能用。