Google 与导演合作推出电影《ANCESTRA》,展示 Veo AI 视频生成技术在专业电影制作中的实际融合案例。
我们与 Darren Aronofsky、Eliza McNitt 以及一支由 200 多人组成的团队合作,使用 Veo 与真人实拍技术制作了一部电影。
Google DeepMind 高级研究科学家
Google DeepMind 与 Primordial Soup 合作制作了短片《ANCESTRA》,该片在翠贝卡电影节首映。影片将真人实拍与 Google 视频生成模型 Veo 生成的视频相结合。Google DeepMind 为 Veo 开发了多项新能力,以实现个性化生成、精准的动作匹配,以及真人实拍素材与生成式素材的融合。
《ANCESTRA》是一部将真人实拍与 Google DeepMind 视频生成模型 Veo 相结合的短片,于翠贝卡电影节首映。
Google DeepMind 与 Primordial Soup 携手合作,将生成式 AI 交到电影创作者手中,推动叙事与技术边界不断向前。
团队使用 Gemini、Imagen 和 Veo,以照片为灵感,按照氛围、色彩和情感生成镜头。
团队为 Veo 开发了多项新能力,用于个性化视频生成、精准动作匹配,以及真人实拍素材与生成素材的融合。
生成式 AI 可以为电影制作提供补充,帮助艺术家突破限制,创作难以拍摄或成本高昂的场景。
今天,Eliza McNitt 的短片《ANCESTRA》在翠贝卡电影节首映。这部影片讲述了一位母亲,以及她的孩子出生时心脏有一个孔洞后发生的故事。影片的灵感来自 McNitt 自己出生时那段惊心动魄的经历,将母爱描绘成一种具有宇宙尺度、能够挽救生命的力量。
这是 Google DeepMind 团队与 Primordial Soup 合作制作的三部短片中的第一部。Primordial Soup 是由导演 Darren Aronofsky 创立、致力于叙事创新的新公司。我们共同建立这项合作,旨在把全球顶尖的生成式 AI 交到一流电影创作者手中,推动叙事与技术的前沿发展。
《ANCESTRA》将真人实拍场景与由我们最先进的视频生成模型 Veo 生成的片段结合在一起。McNitt 如此描述她与我们技术合作的体验:“Veo 就像另一枚镜头,让我能够透过它想象身边的宇宙。”
为了创作《ANCESTRA》,Google DeepMind 组建了一支跨学科创意团队,成员包括动画师、艺术指导、设计师、编剧、技术专家和研究人员。他们与 200 多位传统电影制作与制片领域的专家紧密合作,其中还包括真人实拍剧组和演员,以及剪辑团队、视觉特效(VFX)艺术家、声音设计师和音乐作曲家。
在为《ANCESTRA》编写剧本期间,McNitt 与分镜师合作,将真人实拍场景视觉化;同时,她也与我们的团队合作,为适合使用 AI 生成技术的片段创作影像。
我们使用 Gemini 完善 prompt,并使用 Veo 和我们的图像生成模型 Imagen 创作一系列候选镜头,再按照氛围、色彩和情感进行整理。以下是我们规划并制作影片 AI 元素的具体过程:
Gemini:我们的团队上传了 McNitt 的父亲在她出生当天拍摄的照片,并请 Gemini 用精准的美学细节描述这些照片。这些描述随后成为创作新图像和视频所使用的 prompt。
Imagen:我们生成了影片的关键概念艺术,确立整体视觉、风格和氛围。这些图像成为视频创作的起点。
Veo:我们让生成的图像动起来,并编写额外的文本 prompt 来引导动作与运动,最终制作出成片镜头。
Veo 让我们能够生成把真人表演与逼真新生儿生成素材结合起来的场景,但这也带来了新的挑战。例如,McNitt 希望生成视频能够匹配真人实拍场景的画质与色彩。她还需要控制生成视频中的摄影机运动和主体内容。为了应对这些挑战,我们为 Veo 开发了多项新能力,以实现更强的个性化、精准的动作匹配,以及真人实拍素材与生成式素材的融合。
我们的目标是生成与故事本身一样私密、个性化的视频。例如,McNitt 希望生成一个外观逼真的子宫内胎儿画面,同时控制艺术指导、构图和运动。为此,我们首先对 Imagen 模型进行 fine-tuning,使其匹配参考图像的风格。随后,我们与 Gemini 合作设计并反复完善 prompt,以生成逼真的子宫内胎儿图像。最后,我们使用 Veo 的 image-to-video 能力,将这些图像转化为动态场景。
通过对 Imagen 模型进行 fine-tuning,我们让不同场景中的 AI 生成婴儿保持了具体且一致的艺术风格。
在其中一个场景中,McNitt 希望带领观众在人体内部展开一段旅程,最终抵达子宫,呈现婴儿通过剖宫产出生的过程。为了准确复现这种摄影机运动,我们创建了一个虚拟的 3D 人体模型,并通过控制虚拟摄影机穿过这个模型,录制了该场景的样片。随后,我们使用 Veo 追踪样片中的运动,并以相同的运动轨迹生成新视频。我们通过文本 prompt 引导生成视频,直到最终实现 McNitt 心中设想的镜头。
McNitt 使用虚拟人体模型规划了她想要的摄影机运动。随后,我们利用 Veo 的动作匹配能力,生成了具有相同运动轨迹的视频。
在另一个场景中,McNitt 希望展现一连串有机孔洞逐渐闭合的画面,以此暗示婴儿心脏上的孔洞。因此,我们向 Veo 提供了展现这种运动的参考视频,并通过 prompt 要求它在不同镜头中进行动作匹配。如果只使用计算机生成图像(CGI)制作这些片段,过程会非常复杂且耗时;而如果仅依赖文本 prompt,也很难精准控制运动。在 Veo 的帮助下,我们只需几分钟就能制作出高质量场景。
我们向 Veo 提供了一段包含目标运动方式的输入视频。随后,Veo 将参考运动与文本 prompt 相结合,生成一个动作匹配的新场景。
使用传统 VFX 制作的婴儿影像存在产生诡异感的风险,导演想要得到心中设想的精确表演也非常困难且耗时。因此,在分娩场景中,我们将演员的表演与生成的逼真新生儿组合在一起,使其融入整个场景。首先,我们向 Veo 提供真人实拍素材、描述场景的文本 prompt,以及一个用于添加婴儿的指定区域。随后,我们使用 Veo 的“add object”能力,把 AI 生成的婴儿图像加入真人实拍素材,同时保持其他所有内容一致;最后,再通过传统 VFX 和调色进一步完善镜头。
我们在真人实拍素材中加入了生成的新生儿,并使用 VFX 和调色完善最终镜头。
影片中的许多场景使用了多张 AI 生成图像和多段 AI 生成视频,再通过传统电影制作工作流进行无缝合成。例如,我们创作了一个日落时分、从刚刚孵化的鳄鱼蛋内部观察复杂纹理的场景。为了构建这个镜头,我们使用传统 VFX 合成技术,将多段生成视频和多张生成图像结合在一起。
这个镜头呈现了日落时分从正在破裂的鳄鱼蛋内部向外观察的视角,守护幼崽的鳄鱼妈妈就在附近。我们使用 Veo 和 Imagen 生成关键视觉元素,再通过传统 VFX pipeline 将它们无缝合成,让这一具体的创意构想成为现实。
《ANCESTRA》是我们与 Primordial Soup 联合制作的三部影片中的第一部。此次合作中的每一部影片都由一位新锐电影创作者执导,他们会得到 Darren Aronofsky 的指导以及我们团队的支持。
许多杰出的电影都是使用真人实拍、CGI 和 VFX 工具集创作而成的。生成式 AI 可以补充现有的创意与制作工作流,帮助电影创作者突破现实条件的限制,完成难以拍摄或成本高得令人望而却步的场景。
通过与艺术家合作,我们可以确保自己打造的工具真正实用,并且植根于专业电影创作者的实际需求。与 McNitt 和 Aronofsky 这样的远见者携手合作,有助于我们探索当今技术的创作潜力,并想象下一步还能创造什么。