7 月 31 日,字节跳动 Seed 团队正式发布新一代视频生成模型 Seedance 2.5。距离 Seedance 2.0 在 Artificial Analysis 盲测排行榜登顶不到五个月,这次升级没有停留在参数规模的堆叠,而是瞄准了一个更根本的问题:如何让 AI 生成的不再是一个"片段",而是一个完整的创意作品。
Seedance 2.5 给出了三个回答:单次生成时长从 15 秒翻倍至 30 秒,支持多轮扩展至数分钟;多模态参考输入容量从约 12 个提升至最多 50 个(30 张图片、10 段视频、10 段音频);编辑能力从整段替换升级为时间戳级精确控制,新增 clay render 引用、绿幕编辑和摄像机视角控制。
30 秒的叙事转折
AI 视频生成的上一个瓶颈不是画质,而是时长。15 秒的单次生成上限意味着任何超过这个长度的内容都需要人工拼接——每一刀都会引入角色漂移、光线跳变和动作断裂的风险。
Seedance 2.5 将原生连续生成扩展到 30 秒,这个数字本身并非终点,但配合对镜头衔接和场景过渡的专门优化,它改变了模型能讲述的故事类型。官方展示的一镜到底 demo 中,一个歌手从后台化妆间走过后台走廊、遇见舞者、一起登台完成演出,这不再是单个瞬间的延续,而是一个包含起因、发展、转折和收束的微型叙事。
配合多轮扩展能力,用户可以基于已生成片段平滑追加后续镜头,在角色外观、环境和叙事节奏保持一致的前提下输出数分钟的连贯内容。这一组合也消解了 30 秒与真正长视频之间的距离——连续生成解决单段的叙事完整性,扩展解决总篇幅。
画质层面,Seedance 2.5 声称原生 4K 输出,同时针对 AI 视频中常见的"油腻感"做了系统优化,包括物体纹理、皮肤与眼部细节、光照和色彩饱和度。在此之前,Seedance 2.0 仅支持 1080p,部分用户反馈实际可用画质常落在 720p 档位,高清需求只能依赖后期放大。原生 4K 的加入闭合了一个使用中频繁被报告的缺口。
从 prompt 到 reference:控制的重新定义
多模态参考能力的升级可能是 Seedance 2.5 最被低估的变化。Seedance 2.0 已支持图像、视频、音频和文本四种模态输入,上限约 12 个;Seedance 2.5 将这个数字推到 50 个,且模型需要一次性理解所有这些素材的视觉构图、场景、风格、角色和道具,并按照指令将其应用到生成过程中。
更大规模的参考输入解决的是控制的精确性问题。此前,要在 AI 视频中呈现一个多人场景,创作者主要依靠文字描述角色外观——但文字描述不同角色面部特征的精度天然有限。现在,直接上传 30 张角色参考图,模型需要锁定这些面孔并在多机位变化中保持一致。
技术路线上的关键突破是 clay render 引用。用户可以用无纹理的 3D 白模构建场景的空间结构、角色姿态、运动路径和摄像机角度,模型则基于这个结构生成最终视频,保证复杂镜头的构图和走位与创作者预期相符。此外,Seedance 2.5 改进了光照控制,利用 clay render 中的空间信息生成符合物理规律的光源方向、色温、强度和阴影投射。
这意味着什么?对预可视化和品牌内容团队而言,它把模型从"碰运气生成"变成了一种接近定向渲染的工具。在工业场景中,官方展示的应用包括:参照 clay render 的摄像机走位、构图和运动路径,将其转化为照片级逼真的汽车装配流程视频。
编辑的颗粒度革命
此前所有视频生成工具的核心痛点是"一键生成,无法修改":任何不满意的部分都需要整段重新生成,浪费算力,也无法保证其他满意部分的稳定复现。
Seedance 2.5 引入了时间戳级别的定向编辑。在生成阶段,用户可以按时间段指定叙事节奏、镜头景别和运镜方式;在生成后,可以对特定时间段的角色、动作或情节元素进行定点修改,并维持修改前后的连贯性和真实感。
绿幕编辑的升级同样值得关注。传统绿幕替换只需抠像贴背景,而 Seedance 2.5 的绿幕编辑不仅替换背景,还会计算主体对新环境物理规则的响应——包括衣物飘动方向、头发状态、步态节奏和光线交互。官方 demo 展示了一个运动员从户外训练场景无缝切换到更衣室再到国际赛场的完整叙事,背景、障碍物和配角均被替换,但主体运动保持了连贯。
这些编辑能力的组合指向一个关键变化:视频生成从"一次性消费"转向"迭代式生产"。广告本地化不再需要为每个市场重做整条片子,只需修改需要适配的区域;导演可以保留满意的镜头,只调整特定时间段的内容。
视频生成赛道的分水岭
Seedance 2.5 的发布时机并不孤立。在它前后,MiniMax H3、Kling 3.0 Omni 等模型也在强化参考控制和长序列能力。将 Seedance 2.5 放入更宽的赛道格局中观察,竞争正在从"谁能生成更像真的画面"转向"谁能提供更完整的生产流水线"。
在画质层面,Seedance 2.0 已经在 Artificial Analysis 的盲测中表现优异:Text-to-Video 排行榜(带音频)中 Elo 1223 排名第三,Image-to-Video 排行榜(带音频)中 Elo 1196 排名第一。Seedance 2.5 没有任何独立基准测试数据——官方声称的 prompt 遵循度提升约 20% 和 30 秒一致性均源于内部评测,demo 也经过筛选。
但这反而凸显了 Seedance 路线的真正差异点。Sora 2 强项在物理模拟和复杂叙事,但单次仅 20 秒且无公开 API;Kling 3.0 以低成本($8/月起)和多语言音频同步见长,单次可达 2 分钟以上;Runway Gen-4 拥有最成熟的编辑环境和摄像机控制。Seedance 2.5 选择的不是单点竞争,而是用"音频视频联合生成 + 最大参考输入规模 + clay render 3D 引导 + 时间戳精确编辑"构建一条从创意构思到成品交付的完整链路。
仍未回答的问题
官方博客坦承,"复杂运动的物理合理性和多主体交互场景的稳定性仍有改进空间"。除此之外,仍有若干关键问题待观察:
发布会上展示的所有 demo 均经过筛选,无法反映平均生成质量。独立 benchmark 数据尚未出现——截至发布日,任何对比数据都来自 Seed 团队内部评测。API 目前尚未上线(官方称"近期上线火山方舟"),第三方开发者暂时无法进行规模化测试和集成。工业场景的实际采用(机器人训练数据、自动驾驶仿真)还停留在官方描述阶段,缺乏独立客户案例。
这些不是否决票,而是验证项。一个有价值的信号是:Seedance 2.0 的商用 API 调用量在工作日已超过周末,这是从"玩具"转向"基础设施"的标志。Seedance 2.5 能否延续甚至加速这个趋势,取决于上述独立验证的结果。
模型目前已在即梦 AI 和豆包 Pro 上线。下一个值得观察的变量不是它生成的下一个 demo 有多惊艳,而是第一批独立用户的批量和对比测试数据。