Veo是什么?
Google DeepMind 开发的视频生成AI模型。当前为 Veo 3.1,可从文本或图像生成高清视频,其特点是能把台词、音效、环境音、BGM 等声音与视频同时生成。支持4K,可通过 Gemini 应用、Google Flow、YouTube Shorts 以及 Gemini API/Vertex AI 使用。
可解决的业务课题
「Veo」的服务详情
Veo是什么
Veo 是Google DeepMind 开发的视频生成AI模型。它能从文本或图像生成堪比实拍的高清视频。当前模型为Veo 3.1(2025年10月),其最大特点是不仅生成画面,还能把台词、音效、环境音、BGM 等声音与视频同时生成。相比多数视频生成AI输出的是无声画面,Veo 直接输出带声音的视频。可通过 Gemini 应用、Google Flow、YouTube Shorts 等 Google 各项服务使用。
画面和"声音"从一开始就一起生成
Veo 最大的特点是同时生成视频与声音。角色会以对口型(口型与台词同步)的方式说出提示词中写的台词,脚步声、环境音乃至 BGM 也会配合画面一起生成。在很多工具里画面生成后还要另行配音,而 Veo 一次就能输出带声音的成片。
用参照图像,让角色和世界观保持一致地动起来
可以传入最多3张参照图像,在保持同一角色、同一主体、同一风格的前提下生成视频(Ingredients to Video)。它还支持还原真实世界的物理表现和控制镜头运动,即使跨越多个镜头,画面也不易崩坏,这是它的强项。
使用方法
-
订阅 Google AI 方案
Veo 需在 Google AI Pro 及以上方案中使用。登录 Gemini 应用或影像制作工具 Google Flow。
-
输入提示词或图像
用文本描述想要的画面,或上传作为素材的图像。台词和音效也可以用文字指定。
-
生成视频
数十秒至数分钟内,即可生成带声音的视频片段(默认8秒)。
-
延长·编辑(Google Flow)
可用 Extend 把片段连接延长至1分钟以上,指定起始/结束帧,添加或删除元素,以及升采样到 1080p/4K 等来完成收尾。
-
导出·分享
导出完成的视频。也可以直接在 YouTube Shorts 中生成。
功能
01生成
从文本·图像生成带声音的视频。
- 文本→视频/图像→视频 — 从指令或图像生成画面
- 原生声音生成 — 同时生成台词·音效·环境音·BGM
- 支持4K — 高清画面输出
02一致性·控制
做出符合预期的画面。
- Ingredients to Video — 用最多3张参照图像保持角色·主体·风格一致
- 镜头控制·物理还原 — 取景与镜头运动、真实世界的物理表现
- 对口型 — 口型与台词同步
03编辑(Google Flow)
把片段组合起来收尾。
- Extend — 连接片段延长至1分钟以上
- Frames to Video / Insert·Remove — 帧间补间、添加或删除元素
- 升采样 — 提升到 1080p/4K
价格
Veo 不单独售卖,个人通过 Google AI 订阅,开发者通过 Gemini API/Vertex AI 按量计费使用。
| 使用方式 | 方案·单价 | 内容 |
|---|---|---|
| 个人(订阅) | Google AI Pro ¥2,900/月起 | 在 Gemini 应用·Flow 使用 Veo(有每日上限) |
| 个人(高级) | Google AI Ultra ¥36,400/月 | 在 Flow 完整使用。生成的视频不带可见水印 |
| 开发者(API 按量) | Veo 3.1 Standard $0.40/秒(4K 为 $0.60) | Fast 为 $0.10 起,Lite 为 $0.05 起。均含声音·仅在生成成功时计费 |
所有生成物都会嵌入表明其为AI生成的隐形数字水印SynthID。可见水印会显示在较低档位的输出上,只有 Ultra 方案不带。用 API 的 Standard(720p/1080p)生成8秒视频约为 $3.20(截至2026年8月)。
金额基于2026年8月官方标注。模型世代·价格·提供内容可能变化,最新信息请在Veo 官方页面及各价格页面确认。
在日本的使用与日语支持
Veo 可在日本通过 Gemini 应用等使用,支持日语提示词。使用需 Google AI Pro(¥2,900/月)及以上方案。
与其他视频生成AI的区别
视频生成AI的差异体现在"能否同时生成声音""最高分辨率""与哪些产品生态集成"。Veo 是少数能原生同时生成声音的模型,且深度集成在 Google 各项服务中,这一点尤为突出。
| 观点 | Veo | Sora | Kling |
|---|---|---|---|
| 声音 | 与画面同时生成(支持对口型) | 以画面为主 | 正在扩充声音功能 |
| 最高分辨率 | 4K | 1080p 级 | 1080p 级 |
| 集成 | Gemini·Flow·YouTube·Vertex AI | ChatGPT/Sora | 独立应用·API |
同为文本→视频的还有Sora,表现力与可控性见长的Kling,以及擅长编辑·商用工作流的Runway ML和Luma AI都是比较对象。如果你在使用 Google 的服务,又想便捷地制作带声音的视频,Veo 很有优势。
本页信息基于2026年8月官方网站公开的内容。最新规格·价格请以官方网站为准。


