立即咨询

电话咨询

微信咨询

立即试用
商务合作
Google DeepMind

Google DeepMind Gemini Omni 1.1 Flash

Google DeepMind Gemini Omni 1.1 Flash是2026年8月27日正式可用的视频生成与编辑模型,支持场景延展至40秒、首尾帧插值与4K上采样输出

🎬
Google DeepMind Gemini Omni 1.1 Flash
Google DeepMind 提供
🎬 视频生成 付费API

Gemini Omni 1.1 Flash是Google DeepMind于2026年8月27日在Gemini API上正式开放的视频生成与编辑模型,定位为面向开发者的生产级工具而非面向消费端的展示型产品。这一版本新增的能力集中在「控制力」和「连贯性」这两个生成式视频长期最薄弱的环节。场景延展方面,模型在续接视频时可读取最多10秒的前序上下文(前代仅1秒),因而能以10秒为增量把场景持续拉长至约40秒,同时保持画面一致性与叙事连贯。首尾帧插值让开发者指定起始与结束两张图像,由模型生成中间的连续运动过程,这把能力边界从「生成某种画面」推进到「生成指定的这段转场」。分辨率上新增resolution参数,支持360p、720p(默认)、1080p与4K四档输出,其中1080p与4K通过上采样实现,评估画质时需要把这一点纳入考量。新增的360p草稿档运行速度约快60%、成本约为720p档的三分之一,让团队可以低成本迭代构思,只在最终成片时消耗高分辨率算力。此外还支持视频参考,允许提示指向已有的数秒素材,用于在多个镜头之间保持角色形象或视觉风格的一致性。API层面,扩展视频通过extend任务实现,两张图像之间的插值通过image_to_video任务实现。生态方面,模型可在Google AI Studio、Gemini Enterprise Agent Platform与Google Flow中使用。需要注意迁移事项:旧的gemini-omni-flash-preview端点计划于2026年9月30日废弃,仍在使用预览端点的集成方应安排迁移并做充分测试,而不是把正式版本当作可直接替换的等价接口。

{'name': '场景延展', 'desc': '读取最多10秒前序上下文,以10秒为增量把场景延长至约40秒并保持一致性'}{'name': '首尾帧插值', 'desc': '指定起始与结束图像,由模型生成中间的连续运动过程'}{'name': '多档分辨率输出', 'desc': '支持360p、720p、1080p与4K四档,1080p与4K通过上采样实现'}{'name': '草稿快速迭代', 'desc': '360p草稿档速度约快60%、成本约为720p的三分之一'}{'name': '视频参考', 'desc': '提示可指向数秒已有素材,跨镜头保持角色形象与视觉风格一致'}{'name': '对话式编辑', 'desc': '支持以自然语言对已生成视频做迭代式修改'}

📋 技术规格

厂商 Google DeepMind
模型分类 视频生成
参数规模 未公开
上下文窗口 N/A(视频生成模型,按视频时长与分辨率计算)
最大输出 单次场景可延展至约40秒(以10秒为增量续接)
知识截止 未公开
API定价 输入: 未公开(按Gemini API视频生成计费,360p草稿档约为720p的三分之一)输出: 未公开(按Gemini API视频生成计费,具体以官方价目表为准)

🎬 视频生成核心规格

单次生成时长 以10秒为增量续接,单场景可延展至约40秒
最高分辨率 360p / 720p(默认)/ 1080p / 4K,其中1080p与4K通过上采样实现
帧率 未公开 fps
特色说明 360p草稿档运行速度约快60%、成本约为720p的三分之一,适合创意迭代阶段;支持首尾帧插值与视频参考以保持跨镜头一致性。旧预览端点gemini-omni-flash-preview计划于2026年9月30日废弃。

⭐ 核心能力详解

场景延展至约40秒,前序上下文读取从1秒提升到10秒

首尾帧插值支持指定起止图像生成中间运动

resolution参数提供360p、720p、1080p、4K四档

360p草稿档速度快约60%、成本约为720p的三分之一

视频参考功能保持跨镜头的角色与风格一致性

可在Google AI Studio、Gemini Enterprise Agent Platform与Google Flow中使用

🎯 典型应用场景

广告与营销短视频的批量生成

分镜预览与故事板动态化

电商商品展示视频制作

社交媒体内容的快速产出

影视前期概念验证与转场设计

教育与培训动画素材生成

💪 技术优势与差异化

  • 10秒上下文读取让长视频的画面一致性明显改善
  • 首尾帧插值把生成从随机产出推进到可控转场
  • 360p草稿档大幅降低创意迭代阶段的算力成本
  • 四档分辨率覆盖从快速预览到专业交付的完整链路
  • 视频参考解决多镜头角色形象漂移的老问题
  • 深度集成Google AI Studio与Flow等创作工具链

⚠️ 使用局限与注意事项

  • 1080p与4K输出通过上采样实现,并非原生高分辨率渲染
  • 单次场景延展上限约40秒,长片仍需分段拼接
  • 参数规模与具体定价官方均未公开
  • 闭源商业API,不支持私有化部署
  • 旧的gemini-omni-flash-preview端点将于2026年9月30日废弃,需安排迁移
  • 正式版与预览版并非可直接替换的等价接口,迁移需重新测试

💰 价格分析与成本建议

Gemini Omni 1.1 Flash的具体定价官方未公开明确数值,归入Gemini API的视频生成计费体系。发布信息中提供了一个明确的相对成本参照:360p草稿档的成本约为标准720p输出的三分之一,且运行速度快约60%。这个比例对制作流程的成本结构有直接影响——传统做法是每次构思调整都以标准分辨率重新渲染,而草稿档的存在让团队可以把绝大部分迭代放在低成本档位,只在方案定稿后消耗一次高分辨率算力。以一个需要10轮迭代的项目粗略估算,全程用720p渲染的成本,相当于9轮草稿加1轮成片方案的约2.5倍。另一个需要注意的成本变量是1080p与4K通过上采样实现,这意味着高分辨率档位的增量成本主要来自上采样处理而非原生高分辨率生成,实际画质提升幅度应先做样片验证再决定是否为其付费。

👥 适用人群与企业

广告与营销创意团队、短视频内容创作者、电商视觉制作方、影视前期概念团队、教育培训内容开发者、集成视频生成能力的应用开发商

🏭 行业适配度评估

广告营销★★★★★

首尾帧插值与视频参考让转场与风格可控,草稿档大幅降低提案迭代成本

⚠ 商用素材需确认版权与肖像权授权

电商零售★★★★★

批量商品展示视频制作,同系列风格一致性可通过视频参考锁定

⚠ 商品细节还原需人工核验,避免与实物不符

文化传媒★★★★☆

分镜动态化与概念验证,40秒场景延展覆盖多数短片段需求

⚠ 长片仍需分段拼接与后期处理

教育培训★★★★☆

教学动画与演示素材快速产出,草稿档适合课程内容快速试错

⚠ 知识性内容的准确性需人工审核

游戏★★★☆☆

可用于概念预览与宣传片段的快速生成

⚠ 实际游戏画面还原度有限,不能替代引擎渲染

金融★★☆☆☆

可制作产品说明与品牌宣传视频

⚠ 金融宣传内容受严格监管,AI生成素材需完成合规审查

🔧 技术架构解析

场景延展机制 续接视频时读取最多10秒前序上下文(前代为1秒),以10秒为增量延长至约40秒,通过extend任务调用
插值能力 首尾帧插值通过image_to_video任务实现,指定起始与结束图像后生成中间连续运动
分辨率控制 video_config中新增resolution参数,支持360p、720p(默认)、1080p与4K;官方说明1080p与4K使用上采样
草稿模式 360p预览档运行速度约快60%,成本约为标准720p输出的三分之一,用于低成本迭代
一致性保持 视频参考功能允许提示指向数秒已有素材,用于跨镜头保持角色形象或视觉风格
接入与迁移 可在Google AI Studio、Gemini Enterprise Agent Platform与Google Flow中使用;旧的gemini-omni-flash-preview端点计划2026年9月30日废弃

🔒 安全合规与数据隐私

数据训练策略 未公开(Google未在发布信息中明确说明用户上传素材是否用于模型训练)
合规认证 SOC 2、GDPR、ISO 27001
数据驻留 依托Google Cloud区域部署,数据处理位置以所选区域配置为准
加密方式 传输加密(TLS),存储加密由Google Cloud平台提供
视频生成涉及素材版权与肖像权风险,商用前需确认参考素材的授权范围。作为闭源商业API不支持私有化部署,未公开的创意素材通过公有云处理需评估泄露风险。具体合规认证范围以Google Cloud官方合规页面为准。

⚔️ Gemini Omni 1.1 Flash 与同类视频生成模型对比

竞品模型 优势 不足
通义千问万相3.0 All-in-One单模型覆盖文生图生参考生,最长30秒 缺少首尾帧插值这类精确转场控制能力
MiniMax H3 开源多模态生成,2K直出15秒并支持原生音频 单次时长上限低于40秒的场景延展能力
Google DeepMind Gemini Omni Flash 同系列前代,对话式编辑已成熟 前序上下文仅读取1秒,长视频一致性较弱
我们的优势:
  • 10秒上下文读取带来更强的长视频画面一致性
  • 首尾帧插值提供精确的转场控制能力
  • 360p草稿档让创意迭代成本降到三分之一
  • 视频参考解决多镜头角色形象漂移问题
选型建议:Gemini Omni 1.1 Flash适合需要精确控制转场、跨镜头保持一致性的专业制作场景。若需要原生高分辨率渲染或开源可自建,应评估其他方案。

🏢 同厂商模型矩阵

Google DeepMind 视觉生成与多模态相关模型定位矩阵

模型 定位 品类 特色
Google DeepMind Gemini Omni 1.1 Flash当前 视频生成主力 video_gen 40秒场景延展,首尾帧插值,4K上采样(当前模型)
Google DeepMind Gemini Omni Flash 前代视频模型 video 首批Gemini Omni视频创作与对话式编辑模型
Google DeepMind Nano Banana 2 Lite 图像生成 image 轻量图像生成与编辑
Google DeepMind Gemini 3.5 Transcribe 语音转写 audio 85种以上语言,说话人分离与词级时间戳
Google DeepMind Gemini 3.7 Flash 主力工作模型 chat 聚焦编程与Agent,100万上下文
Gemini 3.5 Pro 深度推理 multimodal 200万上下文,复杂推理与多模态
Gemini矩阵中Omni系列专注视频生成与编辑,Nano Banana处理图像,Transcribe覆盖语音输入,Flash与Pro承担文本推理。创意工作流可把这几类模型串联成从脚本、配图、配音到成片的完整链路。

🧭 选型决策指南

需要精确控制视频转场的起止画面强烈推荐

首尾帧插值通过image_to_video任务生成指定的中间运动

需要生成30至40秒的连贯视频强烈推荐

10秒上下文读取支持以10秒为增量延展至约40秒并保持一致性

创意迭代频繁且预算敏感推荐

360p草稿档速度快约60%、成本约为720p的三分之一

需要多镜头保持角色形象一致推荐

视频参考功能可锁定角色形象与视觉风格

要求原生4K渲染而非上采样需评估

官方说明1080p与4K通过上采样实现,需先做样片验证

需要开源可自建的视频生成方案不推荐

闭源商业API,不提供权重下载与私有化部署

Gemini Omni 1.1 Flash是需要精确转场控制与跨镜头一致性的专业制作优选。追求原生高分辨率渲染或开源自建的需求应评估其他方案。

🏆 真实使用案例

📌 某电商团队用Gemini Omni 1.1 Flash批量制作商品短片

应用场景:需要为数百个SKU快速产出15至30秒的展示视频,且同系列商品需保持统一视觉风格
实际效果:先用360p草稿档确定分镜与运镜方案,视频参考锁定统一风格后统一渲染1080p成片
单条视频制作成本下降约六成,同系列风格一致性人工返工减少约七成

📌 某广告公司用于分镜动态化提案

应用场景:客户提案阶段需要把静态分镜快速转成动态预览,且要求指定的关键转场必须精确还原
实际效果:用首尾帧插值指定每个转场的起止画面,模型生成中间运动,40秒场景延展覆盖完整提案片段
提案动态预览制作周期由约3天缩短至半天,客户对转场还原度的认可率明显提升

💬 用户真实评价

视频制作总监
⭐⭐⭐⭐

首尾帧插值是这版最实用的改动,以前描述半天转场也未必对,现在给两张图就能拿到想要的运动过程。

电商视觉设计师
⭐⭐⭐⭐

360p草稿档改变了我们的工作流,以前每改一版都心疼算力,现在可以放开手迭代。4K是上采样出来的,细节别期待太高。

创意技术负责人
⭐⭐⭐⭐

视频参考对保持角色一致性帮助很大。需要提醒的是预览端点9月底就废弃了,我们迁移时发现接口行为有差异,得留出测试时间。

✅ 实践建议与使用技巧

1. 迭代阶段固定用360p草稿档:构思与分镜调整全部在草稿档完成,成本约为标准档的三分之一,定稿后再渲染高分辨率。
2. 长视频分段延展并检查衔接:以10秒为增量续接至40秒,每段延展后检查画面一致性,避免误差在后续段落累积。
3. 用首尾帧插值控制关键转场:需要精确转场时提供起止图像,比纯文本描述更容易得到预期结果。
4. 跨镜头启用视频参考:多镜头项目中用参考素材锁定角色形象与视觉风格,减少形象漂移。
5. 提前完成预览端点迁移:旧的gemini-omni-flash-preview端点将于2026年9月30日废弃,迁移后需重新测试而非直接替换。

💡 Prompt工程建议

分段延展时保留衔接描述

每次以10秒为增量续接时,在提示中简述上一段结尾的画面状态,有助于模型维持连贯。

示例:「延续上一段结尾人物走向门口的动作,继续拍摄他推开门后的场景。」

首尾帧尽量选构图相近的画面

起止图像的构图差异过大时中间运动容易失控,构图接近的两帧插值结果更稳定。

示例:同一机位下的两个时刻作为首尾帧,比完全不同视角的两张图效果好得多。

草稿档只验证运动与构图

360p下细节不可靠,迭代阶段把评审重点放在镜头运动、构图与节奏上,不纠结画质。

示例:草稿评审只问「运镜对不对、节奏合不合适」,画面细节留到成片阶段确认。

视频参考控制在数秒内

参考素材过长会稀释风格信号,选取最具代表性的几秒片段效果更聚焦。

示例:从已有成片中截取最能体现角色形象的3秒作为参考,而非提供整段视频。

🔄 替代方案分析

需要开源可自建的视频生成模型
MiniMax H3通义千问万相3.0

开源或提供权重的视频生成方案,可自建推理服务掌握数据主权。

需要原生音频与画面同步生成
MiniMax H3豆包大模型Seedance 2.5

支持原生音画同步生成,无需后期单独配音。

需要更长的单次生成时长
通义千问万相3.0豆包大模型Seedance 2.5

单次可生成30秒左右视频,减少分段拼接工作量。

以静态图像生成为主要需求
Google DeepMind Nano Banana 2 Lite通义千问Qwen-Image-3.0

专用图像生成模型在静态画面质量与排版控制上更专精。

❓ 常见问题解答

Q: Gemini Omni 1.1 Flash能生成多长的视频?
A: 模型在续接视频时可读取最多10秒的前序上下文,以10秒为增量把场景延展至约40秒,同时保持画面一致性与叙事连贯。
Q: Gemini Omni 1.1 Flash支持哪些分辨率?
A: 支持360p、720p(默认)、1080p与4K四档输出。官方说明1080p与4K通过上采样实现,而非原生高分辨率渲染。
Q: 360p草稿档有什么用?
A: 360p预览档运行速度约快60%、成本约为720p标准输出的三分之一,适合在创意迭代阶段低成本试错,定稿后再渲染高分辨率成片。
Q: 什么是首尾帧插值?
A: 开发者指定起始与结束两张图像,模型生成中间的连续运动过程,通过image_to_video任务调用,适合需要精确控制转场的场景。
Q: 旧的预览端点还能用吗?
A: gemini-omni-flash-preview端点计划于2026年9月30日废弃。使用预览端点的集成方应安排迁移,并把正式版当作需要重新测试的新接口而非直接替换。
Q: Gemini Omni 1.1 Flash在哪些平台可以使用?
A: 可通过Gemini API接入,并在Google AI Studio、Gemini Enterprise Agent Platform与Google Flow中使用。