Gemini多模态视频生成模型升级,场景扩展从单帧升级到10秒上下文,首尾帧锚定控制摄像机运动,支持4K超分。
Google 发布了 Gemini Omni 1.1 Flash(gemini-omni-1.1-flash),这是其原生多模态视频生成与编辑模型的正式更新。此次发布将 Omni 从一个"能生成视频"的工具升级为"可执导视频"的工具:场景扩展现在可读取最长 10 秒的先前上下文(而非单一的最后一帧),可以固定首帧和尾帧来控制镜头运动,草稿以 360p 渲染、成本仅为 720p 的三分之一,成片可升级至 4K,视频片段可以作为参考传递给模型以保持角色一致性。
Gemini Omni Flash 建立在 Google 区分于先前视频模型的三个特性之上:原生多模态(文本、图像、音频和视频协同处理)、通过 Interactions API 实现对话式编辑,以及继承自 Gemini 的世界知识。编辑是有状态的——你传入 previous_interaction_id,模型在应用你修改的同时保留你没有提及的内容,无需重新上传先前的视频。
用户可通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 访问该模型,Adobe、Figma Weave、GMI Cloud 和 Runway 已列为生产级用户。
Omni 1.1 在延续片段时会分析最长 10 秒的先前上下文。Google 表示此前的模型只参考最后一秒。扩展以 10 秒为增量运行,最多可累积至 40 秒,模型每次调用生成 3–10 秒的延续内容。输入内容的最后若干帧会被编辑以使接缝处连续。
约束条件较为明确:扩展只能在片段末尾追加——不支持在前面插入,也不支持在片段中间插入。上传的视频输入必须不超过 10 秒,除非你是在多轮对话中扩展模型生成的视频。在扩展有人物说话的上传视频时,无法添加新对话;通过 previous_interaction_id 进行多轮扩展时则支持口语对话。
你现在可以提供首帧和尾帧,由模型生成二者之间的连续视频——这就是环绕镜头、移动变焦和无缝循环背后的机制。Prompt 通过标签将媒体绑定到角色:<FIRST_FRAME>、<LAST_FRAME>、<IMAGE_REF_N> 和 <VIDEO_REF_N>。
视频参考最多接受三个片段,每个片段最长 3 秒,最适合用于人物相似度。视频参考内的音频会被忽略。不支持跨多视频推理,否则可能降低输出质量。
response_format 中的 resolution 参数支持 360p、720p(默认)、1080p 和 4k,其中最高两档为超分辨率输出。Google 报告称,基于 360p 相对 720p 的系统吞吐量,360p 预览生成速度提升最高达 60%,成本仅为 720p 的三分之一。这使得"先草稿后升频"成为预期的生产模式:低成本迭代,最后一次性渲染。
输入价格为每 100 万 token 1.50 美元(文本、图像、视频、音频)。输出价格为每 100 万文本 token 9.00 美元,每 100 万视频 token 17.50 美元。视频计费按 720p 每秒 5,792 token 计算,标准定价下约合每秒钟 0.10 美元。
每条生成视频均带有 SynthID 水印——对观看者不可见,但可通过程序检测以追溯来源。值得注意的缺失项:不支持系统指令、temperature、top_p、stop 序列或负面提示词(负面词需写在 prompt 正文中);不支持语音编辑;不支持音频参考;不能使用 YouTube URL 作为来源。英语已完全支持;其他语言未做评估。对于超过 4MB 的输出,请使用 delivery="uri" 并通过 Files API 轮询直至文件状态为 ACTIVE。
Google 列出了 Adobe(Firefly)、Figma Weave、GMI Cloud 和 Runway 作为已在生产环境中运行 Omni Flash 的客户。该模型也在 Google Flow 中向 AI Plus、Pro 和 Ultra 订阅用户开放,场景扩展功能可在 Gemini 应用中使用。
查看 Google 博客公告、Gemini API Omni 文档、Gemini API 定价页面,以及 Omni 快速入门烹饪书。此外,欢迎关注我们的 Twitter,加入我们的 15 万+ ML SubReddit 并订阅我们的通讯。你用 Telegram 吗?现在也可以加入我们。
有意与我们合作推广你的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会等?请联系我们。
Michal Sutter 是数据科学专业人士,拥有帕多瓦大学数据科学理学硕士学位。凭借在统计分析、机器学习和数据工程方面的坚实基础,Michal 擅长将复杂数据集转化为可操作的洞察。