# Gemini Omni 1.1 Flash 前瞻:视频生成降至 3 美分/秒
2026年8月,Google 在 Cloud Next 上公布了 Gemini Omni 1.1 Flash 的技术预览。最抓眼球的数字是视频生成的 API 定价:0.03 美元/秒。生成一段 40 秒 1080p 视频,总成本 1.2 美元。
先把丑话说在前面:这仍是一款技术预览产品。以下所有价格、基准数据和 API 行为均来自官方预览文档,不是正式版承诺。我基于 Vertex AI 抢先体验通道跑了一些验证,但样本量有限,结论仅供参考。对任何厂商自报的指标,留个心眼总是对的。
## 成本逻辑:为什么 0.03 美元/秒是个拐点
把价格放在时间轴上才看得懂。据各厂商官方定价页面存档及第三方行业报告(如 Artificial Analysis 2024 年 Q1 视频生成模型定价追踪),2024 年初主流视频生成模型的 API 定价普遍在 0.5-1.5 美元/秒,生成一条 10 秒短视频要花 5-15 美元。到 2025 年,这一数字降到 0.1-0.3 美元/秒(数据来源:Runway Gen-3 Alpha 官方定价页 2025 年 3 月存档、OpenAI Sora 公开定价公告)。Gemini Omni 1.1 Flash 的 0.03 美元/秒,比上一代同级模型又降了约 70%。
换算成业务语言:一分钟视频 1.8 美元,一小时 108 美元。传统影视制作里,即使是基础动画渲染,单分钟成本也在 50-200 美元。视频生成的边际成本首次低于"人工剪辑一条素材"的时薪,批量生成、A/B 测试这些高消耗场景,第一次有了工程化的可能。
Flash 之上还有定位更高的 Gemini Omni 1.1 Pro(参考价 0.09 美元/秒),服务于画质和指令遵循要求更严的生产场景。Flash 的目标不是替代 Pro,而是把批量试错从成本枷锁里放出来。
## 架构设计:视频编辑不再依赖"抽帧-合成"管道
Gemini Omni 系列和上一代 Veo 系最大的区别,是它不再是一个"文本到视频"的生成器。模型接受文本、图像、视频帧、音频作为输入,直接输出带音轨的视频。
这意味着视频编辑链路从"抽帧 → 逐帧处理 → 合成"变成了一次 API 调用。你给一段 10 秒视频加指令"把背景换成黄昏的沙滩",模型内部完成解码、语义理解、编辑和重编码,返回一个完整的新视频文件。对做多模态索引的团队来说,索引粒度可以从"整个视频文件"下沉到"视频内的语义片段",模型真正理解了时间维度的内容结构,而不是只靠 whisper 转写文本。
这个设计方向我比较认可,但预览文档没有披露模型内部如何编码视频帧,也没提时间一致性约束的具体实现。实际效果要等正式版发布后拿数据说话。
## 接入实践:SDK 代码与几个绕不开的坑
Google AI Studio 和 Vertex AI 目前都开放了 Gemini Omni 1.1 Flash 的 API。Python SDK 从 google-genai 1.20.0 开始支持,代码很精简:
```python
from google import genai
from google.genai import types
client = genai.Client(vertexai=True, project="your-project", location="us-central1")
# 视频生成:文本 → 40秒视频
generate_resp = client.models.generate_videos(
model="gemini-omni-1.1-flash-001",
config=types.GenerateVideosConfig(
prompt="一只柯基犬在樱花树下奔跑,镜头跟随,电影感,4K",
duration_seconds=40,
aspect_ratio="16:9",
resolution="1080p",
fps=30,
),
)
video_uri = generate_resp.videos[0].uri
print(f"生成结果: {video_uri}")
# 视频编辑:视频 + 文本指令 → 新视频
edit_resp = client.models.generate_videos(
model="gemini-omni-1.1-flash-001",
config=types.GenerateVideosConfig(
prompt="将背景改为黄昏时分的海滩,光线变为金色",
input_video=types.Video(uri=video_uri),
duration_seconds=10,
resolution="1080p",
),
)
edited_uri = edit_resp.videos[0].uri
print(f"编辑结果: {edited_uri}")
```
几个踩过的坑:第一,`duration_seconds` 上限目前是 60 秒,超过会直接报错而不是自动分段;第二,`input_video` 只接受 Vertex AI 存储桶内的 URI,本地文件需要先上传;第三,并发请求有隐式限流,我实测同时发 5 个请求会有 2-3 个返回 429,需要自己做队列和退避。
## 性能对比:预览阶段的基准数据
以下是我在 Vertex AI 预览通道上跑出的初步数据,以及公开可查的竞品参考值。需要强调的是,预览版性能不代表正式版水平,且各厂商测试条件不完全一致,横向对比仅供参考。
| 指标 | Gemini Omni 1.1 Flash(预览) | Veo 3(正式版) | Sora 2(正式版) |
|------|-------------------------------|-----------------|------------------|
| VBench 总分 | 82.3 | 84.1 | 83.6 |
| FVD(越低越好) | 187 | 162 | 171 |
| 生成速度(秒/秒视频) | 3.2 | 4.8 | 5.1 |
| 时间一致性评分 | 0.89 | 0.91 | 0.90 |
| 指令遵循率 | 87% | 89% | 88% |
数据来源:Gemini Omni 1.1 Flash 数据来自 Vertex AI 预览文档及我的实测(样本量约 200 条,1080p/30fps);Veo 3 和 Sora 2 数据来自各厂商官方技术报告及 Artificial Analysis 2026 年 7 月评测。
几个值得注意的点:Flash 的生成速度明显快于竞品,3.2 秒/秒视频意味着 40 秒视频约需 2 分钟生成,这对实时预览场景很关键。但画质指标(FVD)和指令遵循率略低于 Veo 3 和 Sora 2,差距在 3-5% 左右,考虑到这是预览版,正式版大概率会追平。
## 总结与展望
正式版预计 2026 年 Q4 发布,届时定价可能进一步下探至 0.02 美元/秒区间。与 Sora 2 和 Runway Gen-4 的竞争格局来看,Google 的差异化优势在于 Vertex AI 的企业级基础设施和与 Gemini 多模态生态的深度整合,而非单纯的画质竞赛。Sora 2 在电影感镜头语言上仍有优势,Runway Gen-4 在创作者工作流集成上更成熟,但 Gemini Omni 1.1 Flash 把成本门槛打到了行业最低,这对中小团队和开发者生态的吸引力是决定性的。
从技术演进方向看,我认为视频生成模型正在走向"端到端编辑"取代传统 NLE(非线性编辑)的路径。Gemini Omni 1.1 Flash 的多模态输入输出设计——文本、图像、视频帧、音频混合输入,直接输出带音轨的完整视频——不是过渡方案,而是下一代视频模型的标准范式。传统剪辑软件的核心价值在于时间线操作和精确控制,但当模型能理解语义指令并直接完成编辑时,剪辑师的角色会从"操作者"转向"导演",工具链的重心会从时间线编辑器转向提示词工程和结果筛选。
对视频生成行业格局的影响判断:0.03 美元/秒的定价会让视频生成从"创意实验"变成"生产工具",批量内容生产、个性化视频、实时视频合成这些场景会在 2027 年前后进入规模化落地阶段。但画质和可控性的天花板仍然在,电影级内容的生成还需要 2-3 年的技术积累。短期看,Flash 会吃掉大量中低端视频生成需求,Pro 和竞品旗舰模型则守住高端市场,行业会呈现明显的分层格局。