Gemini Omni 把文本、图片、视频与部分音频参考放进同一创作流程,先从视频输出开始,支持对话式生成、混合和编辑。

Gemini Omni 的野心不是再做一个单独的视频模型,而是让同一个系统理解多种参考素材,并通过对话完成生成、混合和编辑。Google 先开放视频输出,未来才计划扩展为“任意输入到任意输出”。
它目前能处理哪些输入
Google 在 I/O 2026 发布 Gemini Omni,称其结合 Gemini 的知识与生成式媒体模型。用户可把文本、图片或视频作为参考,并在起步阶段使用语音类音频参考,其他音频输入计划随后加入。

系统不仅根据一句提示生成片段,还能围绕现有素材继续对话式修改,例如调整电影感镜头、替换背景,或把现实拍摄素材与生成内容混合。Google 强调模型对重力、动能和流体等物理现象的理解有所提升,以改善画面运动的可信度。
哪些产品已经接入
Gemini Omni Flash 面向 Google AI Plus、Pro 和 Ultra 订阅者,通过 Gemini 应用与 Google Flow 在全球逐步推出。YouTube Shorts Remix 和 YouTube Create 也提供相关入口,面向符合条件的成年用户。
在 Gemini 应用中,用户可以上传相册里的照片或视频,套用模板,再用自然语言连续编辑。Flow 更偏向专业创作流程,强调真实素材与生成素材融合,以及跨镜头维持人物身份和声音的一致性。
统一模型带来的变化
过去的 AI 视频流程往往需要分别处理文生图、图生视频、配音和剪辑,再由创作者手动协调风格。统一模型的方向,是让系统同时理解素材之间的语义关系和最终叙事目标,减少工具切换。
但“统一”不等于成片可以直接发布。人物肖像授权、声音克隆许可、素材版权、事实真实性与平台规则仍需单独检查。尤其使用真人照片和声音时,应先取得明确授权并保存来源记录。
生成内容如何识别
Google 表示,Omni 生成的视频会加入不可见的 SynthID 数字水印,并可在 Gemini 应用、Chrome 中的 Gemini 和搜索中进行验证。数字标记有助于内容溯源,但不应被理解为真实性保证;它主要说明素材是否经过特定生成系统处理。
YouCanStudy.AI 的判断
Gemini Omni 代表生成式媒体正在从“选择哪一个模型”转向“组织怎样的创作意图和参考资产”。创作者的价值不会只剩按按钮,而会更多集中在素材选择、镜头判断、连续性、授权与最终审校。模型越统一,前期约束和后期验收反而越重要。