字节Seedance 2.5升级长视频生成
字节推出Seedance 2.5视频生成模型,支持30秒长视频一镜到底生成和多模态灵活编辑。
字节推出Seedance 2.5视频生成模型,支持30秒长视频一镜到底生成和多模态灵活编辑。
今天,我们正式推出 Seedance 2.5,这是新一代视频创作模型。自 Seedance 2.0 发布以来,我们注意到用户对视频创作模型的期待发生了转变:从仅生成一个片段转变为完成一部创意作品。基于 Seedance 2.0 统一的多模态音视频联合生成架构,Seedance 2.5 重点关注基础生成和基于参考的生成,在长篇幅叙事、多模态参考和编辑方面实现了重大突破。植根于现实应用场景,它为创意想象和控制力打开了更大空间,进一步释放了生产力。
主要亮点包括:
单次最多 30 秒,支持多轮扩展: Seedance 2.5 可在一次生成中创建高质量的 30 秒音视频片段,并支持多轮扩展。它还改进了镜头转换和场景变化,使长视频的连贯性更强,在图像、音频和运动质量上取得显著提升,呈现出比常见 AI 生成视频更自然、更精致的视觉质量。因此,用户可以用一致的音视觉语言生成高质量的多分钟内容,通过一键创作将完整的故事带到生活中。
全面升级的多模态参考: 用户现在可在一次生成中输入最多 30 张图像、10 个视频片段和 10 个音频片段作为参考素材。该模型还加强了一系列参考能力,包括粘土渲染、运动和创意参考,使其能更好地把握创作者意图,实现涉及多个主体、场景和镜头变化的复杂创意。
更精准、更稳定的编辑能力: Seedance 2.5 提供时间戳级别的控制,用于精准编辑音视频内容,显著提高了效率和可控性。该模型还增强了高级编辑功能,如绿屏、摄像机视角和基于参考的编辑,以满足电影和广告等专业、复杂领域的严格需求。
凭借长篇幅叙事、多模态参考和编辑方面的进展,Seedance 2.5 超越了更长的单次生成视频。该模型更好地理解了创意意图,并以更强的控制力实现了从创意到成品视频的全过程。现在,我们邀请您观看一部由 Seedance 2.5 全流程制作的创意短片。
今天,Seedance 2.5 正在 Jimeng AI、Doubao Pro 和其他平台上线,API 访问即将通过 BytePlus ModelArk 提供。我们邀请您试用并分享您的反馈。
https://seed.bytedance.com/seedance2_5
Jimeng Web → Video Generation → Select Seedance 2.5
Doubao Pro → Video Generation → Select Seedance 2.5
Seedance 2.5 将单次视频生成能力从 15 秒扩展至 30 秒,并进一步增强了长视频的叙事能力。在 30 秒内,该模型能组织多个逻辑相连的镜头,使故事通过设置、发展、转折和解决进展,而不是简单地延伸单一时刻。例如,在一个歌手舞台表演的一键创作片段中,该模型呈现了歌手与化妆间工作人员互动,然后走过后台走廊、与舞者相遇、与他们一起登上舞台表演的完整故事,而不仅仅是登上舞台的时刻。
文本到视频提示词:单次手持稳定器跟拍镜头。摄像机缓缓推进穿过一条厚重红窗帘的缝隙,进入一间温暖色调的后台化妆间。一位年轻的女歌手背对摄像机,正在调整她的耳麦,工作人员提醒她该上台了。她转向摄像机并开始唱城市流行乐。摄像机拉回并跟踪她穿过窗帘进入昏暗的后台走廊,一路与她的舞者自然互动;一位工作人员递给她一麦克风。她与舞者随后登上舞台,摄像机绕到后方,逐渐展现出红黑色舞台设计、LED 屏幕、聚光灯、烟雾和反光地板。摄像机最终拉出到竞技场的宽镜头,呈现拥挤的观众、灯光控制台、荧光棒和欢呼的人群,捕捉演唱会青春洋溢、自由奔放的高潮时刻。
得益于该模型的多轮扩展能力,用户可以顺利地将后续镜头添加到现有视频输出中。在整个扩展过程中,它保持了主要角色、环境和叙事节奏的一致性。这使用户能够一次输出持续数分钟的视频,减少了分割片段、重复拼接素材和修复转换的工作量。
参考到视频提示词:扩展视频。从@视频 1 的视觉内容和主体出发,生成另一个 30 秒片段,保持角色主体、场景、视觉风格和音效的一致性。小男孩一边拿着足球沿着列车车厢跑动。当地铁停下时,侧门打开,他立即冲了出去,男主角在后面追赶。两人跑过站台冲到街道上,一路惊吓路人和车辆。男主角终于追上并抓住了他。男孩抬头看着,委屈地看着。男主角的愤怒慢慢消退,他拍了拍男孩的头,露出无奈的微笑。
在视觉呈现方面,该模型在摄像机运动之间实现了更平滑的转换。主体在多个镜头间保持稳定,音视效保持同步,从而产生高度连贯的长形式视频。例如,在京剧场景中,摄像机跟随主角飘动的水袖执行优雅的圆形摇镜,而主体和背景保持完全一致。水袖的摆动在空中形成自然的弧线,严格遵循现实世界的物理规律。
参考到视频提示词:16:9 宽屏、电影质感、单一连贯镜头、平滑摄像机运动、无剪切。场景参考:@图像 4。0–5秒:以@图像 2 的霸王特写开场。摄像机缓缓环绕其上身并过渡到中景。霸王旋转转身,其身体和背旗快速掠过镜头形成自然遮挡,摄像机跟随到@图像 1 中虞姬的一侧。6–10秒:摄像机稳定地在@图像 1 的虞姬周围中景环绕,跟随她的水袖走过弧线。她抬起手臂,轻轻挥动手腕,展开水袖,半转身。随后她收起水袖,保持姿态,侧眼看向霸王。11–20秒:@图像 3 中的武士以空翻动作进场。霸王居中舞台,而武士在对面进退交击。虞姬站在霸王略后方和侧面,穿插水袖动作形成柔中带刚。摄像机缓缓从武士的中近景拉回到全舞台视图。最后,三人面向观众做出同步的京剧谢幕姿态。
此外,为了解决 AI 生成视频中经常出现的过度人工感,Seedance 2.5 系统性地优化了对象纹理、皮肤和眼睛特征、光照和色彩饱和度等细节。该模型还最小化了字幕和背景音乐中不可控的出现,提供最终产品近似现场拍摄素材的电影质感。
Seedance 2.5 进一步加强了多模态参考生成能力。它允许用户在一次生成中输入最多 30 张图像、10 个视频片段和 10 个音频片段作为参考素材。更大的参考量和更广泛的参考种类能更好地捕捉用户意图,生成具有更多主体、更丰富场景和更灵活摄像机工作的复杂视频。
该模型全面理解所有素材中的视觉构图、场景、风格、人物和道具等元素,并按指示将其应用于视频生成过程。即使在多人物镜头或群体叙事等复杂场景中,它也能保持多个人物的外观和声音,同时保持每个主体特征的稳定性。
R2V 提示词:一段 30 秒、16:9 横屏的音乐会场景,采用电影级写实风格,呈现真实的音乐厅灯光与阴影、温暖的金色舞台灯光,以及正式古典音乐会的氛围。场地使用 @Image 1。钢琴家参考 @Image 2。大提琴参考 @Image 3。小提琴参考 @Image 4。主唱必须严格遵循 @Image 5。管弦乐团的其余成员参考 @Images 6 to 10。合唱团参考 @Images 11 to 14。观众席参考 @Images 15 to 18。主唱从舞台中央走向舞台前沿。钢琴家位于钢琴旁。管弦乐团分布在舞台两侧及后方。合唱团站在舞台后部。开场采用高角度广角镜头,展现整座音乐厅。钢琴家按下琴键,主唱走入聚光灯下并开始演唱。镜头自然地在正在共同演奏的小提琴、大提琴和管弦乐团之间移动,小提琴音色明亮,大提琴音色温暖。后半段,合唱团加入演唱。主唱与前排观众进行短暂的眼神交流,观众以微笑和轻轻点头回应。结尾镜头中,摄影机向后拉远。演唱结束,观众一起鼓掌。
Seedance 2.5 还增强了白模渲染、动作参考和创意参考等特定参考能力,使用户能够更精细地控制画面中的主体、动作和镜头。例如,通过白模渲染参考,用户可以使用无纹理的 3D 模型构建场景的空间结构、角色姿势、运动路径和镜头角度。模型随后利用这一结构生成视频,确保复杂镜头的构图和场面调度高度符合创作者的预期。此外,Seedance 2.5 还改进了光照控制。借助白模渲染提供的空间信息,它可以生成遵循物理规律的逼真光照效果,包括光源方向、色温、强度和阴影投射,从而使最终输出中的光影更加自然。
R2V 提示词:镜头运动、节奏、景别转换、主体轨迹和场面调度参考 @Clay Render 1。角色设计、场景、材质、光照、色彩和童话氛围参考 @Image 2,将白模渲染为一部梦幻、温暖、富有童真幻想感的 3D 动画短片。故事按以下顺序展开:飞越幻想天空 → 神兽相伴穿行云海 → 俯冲进入海洋 → 与蝠鲼一同穿梭深海 → 穿过镜像时空裂隙 → 在宇宙中摘取星星 → 变回卧室 → 父亲为孩子盖好被子 → 绘本合上,并定格在最后一帧。
在视频创作过程中,用户通常既需要在生成阶段控制节奏,也需要在生成后打磨细节。动作具体发生在哪一秒、镜头切换的精确时机,以及某个片段中角色的动作是否需要调整,都会对最终效果产生深远影响。更加精确、可靠的编辑能力,可以帮助创作者准确地将想法变为现实,提高效率,并降低重复生成的成本。
Seedance 2.5 支持通过时间戳进行精确的内容编辑。在生成阶段,用户可以使用提示词控制特定时间段内的叙事、镜头视角、运动和整体节奏,使输出结果更贴合其创作意图。生成完成后,用户可以针对特定片段中的角色、动作或情节元素进行定向修改,同时保持编辑前后的连续性与真实感。
Seedance 2.5 还提升了绿幕编辑、镜头视角编辑和基于参考的编辑等多项功能,以满足影视、广告等专业领域的严格要求。例如,在绿幕编辑中,模型可以在保持主体不变的同时替换背景,讲述完全不同的故事。此外,它还能出色地呈现主体如何响应新环境中的物理规则,包括衣物飘动的方向、头发的状态、步态节奏以及与光照的交互,确保主体与场景和谐融合。
R2V 提示词:使用 @Video 1,对绿幕背景、障碍物、服装和配角进行渲染。0–4 秒:户外训练,将障碍物替换为岩石、砖块、轮胎和木箱。4–10 秒:更衣室,朋友们为其加油鼓劲。10–15 秒:国际比赛,将训练杆替换为原创设计的防守球员和守门员,主角完成进球。整体采用照片级写实风格和电影级画质。
R2V 提示词:编辑 @Video 1。保持角色、动作和视觉风格不变,仅调整镜头运动。采用一套 15 秒的分段镜头方案:0–4 秒,微型 FPV 镜头紧贴煎锅掠过,随后跟随弹起的吐司,并快速甩镜至咖啡;4–7 秒,沿煎锅边缘推进并横向跟拍,跟随煎蛋翻起并落回原位;7–11 秒,快速升至俯视视角,随后以稳定速度下降,扫过餐盘和钥匙;11–15 秒,使用手持特写镜头跟随双手进行快速横向甩镜,随后推近早餐,再拉远至双人中景。保持整个镜头序列流畅、连续且稳定。
随着模型能力不断发展,Seedance 2.5 正在进一步深入教育、制造等更广泛的行业场景。在教育领域,该模型已经开始进入真实的学习场景。例如,Seedance 2.5 可以将课程背后的历史背景、人物和故事情节转化为更加生动、更具沉浸感的视觉内容。它还能帮助教师更高效地制作教学视频,将科学原理、历史事件、实验步骤等抽象内容转化为动态演示。这不仅降低了教育材料的制作门槛,还能实现高度灵活的内容定制。
豆包爱学 App「豆包课堂」场景示例
R2V 提示词:富有表现力的东方绘画风格。南宋临安街景。几个孩子一边穿过熙熙攘攘的街道奔跑,一边大声吟诵:“蓦然回首,那人却在,灯火阑珊处。”镜头跟随奔跑的孩子们,掠过热闹的街市。随后镜头向上倾斜,展现参考 @Image 1 的辛弃疾。辛弃疾转过头,远处一名男子正站在渐暗的灯火之间。全程保持连续镜头。
在工业制造、具身智能和自动驾驶等领域,Seedance 2.5 正逐渐融入高度具体的生产工作流。该模型能够生成高质量的合成视频数据,用于帮助训练机器人的感知与操作能力。它还可用于工业仿真、流程培训和设备演示。在自动驾驶领域,该模型能够模拟极端天气和复杂交通状况等长尾场景,为系统测试与训练提供更多样化的样本。
R2V 提示词:镜头运用、构图、景别、空间关系、零部件位置、模型结构、装配顺序和运动路径参考 @Clay Render 1。材质、光照、色彩、反射和氛围参考 @Image 1,将白模渲染为一段高端、照片级写实的汽车装配视频。
Seedance 2.5 在理解和渲染真实世界方面迈出了重要一步,将视频生成从片段级输出提升至完整的创作工作流。与此同时,我们也认识到它仍有改进空间,尤其是在复杂运动的物理合理性,以及多主体交互场景的稳定性方面。
展望未来,Seed 团队将继续探索更连贯的叙事方式,提供更加直观的生成与编辑体验,并进一步加深模型对真实世界物理规律的理解。我们希望 Seedance 模型能够变得更加生动、更可控,也更善于理解用户意图,帮助更多用户表达创意,同时持续探索并服务于更广泛的行业需求。