Google发布Gemini Omni多模态AI模型
Google推出Gemini Omni,集成视觉、语音、文本多种模态能力。标志通用AI模型的重大进步,对AI应用开发有直接影响。
Google推出Gemini Omni,集成视觉、语音、文本多种模态能力。标志通用AI模型的重大进步,对AI应用开发有直接影响。
Gemini Omni Flash 是一个模型,可以从任何输入创建任何东西——首先是视频。
Google DeepMind CTO 兼 Google 首席 AI 架构师
去年,Nano Banana 将 Gemini 的智能应用于图像生成和编辑。自那以后,它帮助数百万人恢复了旧照片、从草图进行设计,以及用前所未有的方式可视化创意。从一开始,我们就将 Gemini 构建为原生多模态的系统,现在我们正在向前迈出下一步。
我们推出 Gemini Omni,它将 Gemini 的推理能力与创意生成能力结合在一起。Omni 是我们新推出的模型,可以从任何输入创建任何内容——首先是视频。借助 Omni,你可以将图像、音频、视频和文本作为输入结合起来,并生成基于 Gemini 真实世界知识的高质量视频。你还可以通过对话轻松编辑你的视频。
今天,我们向 Gemini 应用、Google Flow 和 YouTube Shorts 推出 Omni 系列中的第一个模型:Gemini Omni Flash。未来我们将支持图像和音频等输出模式。以下是 Omni 的一些特别之处:
Gemini Omni 为你提供了一种更简单的视频编辑方式——使用自然语言。每条指令都建立在前一条的基础上。你的角色保持一致,物理规律成立,场景记住了前面发生的事情。
改变特定的东西,或改变一切。你的视频成为了你无法亲自拍摄的东西的起点。
提示:把雕塑做成泡泡。
拿一个你拍摄的视频,只需要求 Omni 改变发生的事情。编辑动作、添加新角色或物体,或将一个时刻转化为意想不到的东西。
提示:当人接触镜子时,让镜子像液体一样美丽地涟漪,人的手臂变成反射镜面材料。
提示:昏暗房间的灯光。将黑白棋盘房间放在漂浮在手上方的玻璃球内,其中包含相同手持球的递归表示,创建房间的无限递归。摄像机慢慢靠近球体,创建视频循环。
提示:公寓的灯光开始与音乐同步地亮起。
改变环境、角度、风格,甚至特定的细节,同时不失去原始场景的线索。滚动浏览轮播以查看编辑如何相互构建。
提示:小提琴手演奏一首歌的视频。
提示:将小提琴手传送到图像环境
提示:让小提琴隐形
提示:将摄像机角度改为小提琴手肩膀上方。
Gemini Omni 不仅能构建看起来真实的场景,它能推理接下来应该发生什么。它将对物理的直观理解与 Gemini 关于历史、科学和文化背景的知识相结合,在逼真度和有意义的叙事之间架起桥梁。
Omni 对重力、动能和流体动力学等力有更深入的直观理解,让你能够创建更逼真的场景。
提示:大理石在连锁反应式轨道上快速滚动,连续平滑的镜头。
Omni 利用 Gemini 的知识以远超过模式匹配的方式连接语言、意象和含义。
提示:视频显示字母表中的项目。每个字母开头的不寻常项目显示在桌子上(比如 C 的草泥马、D 的迪斯科球和 L 的熔岩灯)。全部 26 个字母必须由 26 个项目表示,并配有匹配的下三分之一标签显示该字母。一次只显示一个项目和下三分之一。每个下三分之一必须看起来像用黑色记号笔写在纸条上的样子,位于左下角。快速连续,大约每项在 24FPS 下进行 9 帧。最后一帧是"THE END"纸条。整个视频由平静流畅的音乐伴随。
Omni 可以从简短的提示创建引人注目的解说员,生成打破更复杂想法的视觉效果。
提示:粘土动画解说蛋白质折叠,一切都由粘土制成,没有手,定格动画,准确
Omni 将任何参考——图像、文本、视频或音频——转化为单一、连贯的输出。虽然起初只支持语音参考进行音频输入,但我们很快就会推出其他类型的音频输入。
提示:基于 image_0.png 的动态科幻电影风格视频。元素点亮方式类似于 video_0.mp4 与 audio_0.wav 中音乐的节拍同步
提示:参考 video-0 中的极端摄像机运动、视角和扭曲,使用 image-0 中的角色创建正面全身行走循环,在行走循环中快速风格转换为多种视觉风格,从逼真的电影开始。保持环境,仅改变风格。硬切背景始终将天空居中。连续行走、连续音频以及完美同步到音频节拍的风格转换。电影级,16:9。
提示:当我触摸每个蕨叶时添加与之同步的竖琴声。将叶子结构改为都像半透明的 3D 生物发光植物生命,带有反应我的演奏的生物发光萤火虫在其周围飞舞,与声音同步,微妙的光圈深度动态照明,反射在房间的墙壁上,保持房间结构相同
使用输入参考,你可以使用角色、场景或绘画的图像以匹配你的愿景的方式创建。
提示:想象世界逐渐改变为复古未来主义风格(像 image-1 一样粗糙和阴暗),当我行走时。使用音频作为复古未来主义背景音乐。10 秒。
提示:将其变为逼真的镜头,仅使用绘画作为运动指南,不要在最终视频中显示绘画
提示:将输入视频中的姿势和运动应用于所提供图像中的角色。将图像参考中的风格应用于新视频
使用输入参考定义视觉语言,或仅用自然语言描述它。Omni 融合输入参考以创建连贯的片段。
提示:编辑此视频保持一切相同。从滑板添加动画运动效果
提示:将提供的视频中的鲸鱼游泳运动应用于提供的流动反射材料图像。不要显示鲸鱼或水;而是让这种反射运动材料形成类似于鲸鱼游泳时的形状。用移动的白色光滑材料形状替换水
我们致力于负责任地开发 AI,并制定了明确的政策来保护用户免受伤害并管理我们 AI 工具的使用。首先,你可以通过使用化身用自己的声音创建视频,化身创建你的数字版本,以便你可以生成看起来和听起来像你的视频。除了化身功能之外,在编辑视频以改变音频和语音方面,我们仍在努力测试这一功能,并更好地理解我们如何能够负责任地将此功能带给用户。
所有使用 Omni 创建的视频都包含我们无法察觉的 SynthID 数字水印。你可以通过 Gemini 应用、Chrome 中的 Gemini 和 Google 搜索轻松验证视频是由 Gemini Omni 生成的。你可以在我们的博客文章中了解更多关于我们如何扩展内容透明度和验证工具的信息,以帮助你理解内容如何在网络上创建和编辑的。
今天,我们推出 Omni 系列中的第一个模型——Gemini Omni Flash。Gemini Omni Flash 今天向全球通过 Gemini 应用和 Google Flow 的所有 Google AI Plus、Pro 和 Ultra 订阅者推出。它也从本周开始以零成本向 YouTube Shorts 和 YouTube Create App 上的用户推出。
在接下来的几周内,我们也会通过 API 向开发者和企业客户推出。