概览/OpenAPI/AI 视频

AI 视频

Omni 与 Veo 的模型级请求和编辑能力。

AI 视频

AI 视频使用 ai_video。创建前读取 generation_models[],不要按模型创建不同 endpoint 或 type。

Gemini Omni Flash

{  "type": "ai_video",  "prompt": "镜头缓慢穿过雨夜未来城市,霓虹倒映在街道上,保留自然环境声",  "aspect_ratio": "16:9",  "video_generation": {    "model": "gemini-omni-flash",    "task": "text_to_video",    "resolution": "720p",    "duration_seconds": 8,    "native_audio": true  }}

Omni 支持 iterate 多轮编辑,调用方不需要管理 interaction ID。

Veo 3.1 Fast

{  "type": "ai_video",  "prompt": "一架纸飞机穿过明亮的现代图书馆,电影感运镜",  "aspect_ratio": "16:9",  "video_generation": {    "model": "veo-3.1-fast",    "task": "text_to_video",    "resolution": "720p",    "duration_seconds": 8,    "native_audio": true  }}

Veo 3.1 Standard

{  "type": "ai_video",  "prompt": "日出时分的海岸科研站,缓慢推进镜头,真实环境声",  "aspect_ratio": "16:9",  "video_generation": {    "model": "veo-3.1-standard",    "task": "text_to_video",    "resolution": "720p",    "duration_seconds": 8,    "native_audio": true  }}

Veo 不支持多轮编辑。当前 Public OpenAPI 仅开放文本生成,首帧、尾帧和附件暂不接受;以 Catalog 返回能力为准。

为运动优先的内容选择 AI 视频

短时动态画面、产品氛围、电影感 B-roll,或需要由运动和声音传达重点的概念,适合使用 AI 视频。将主体、动作、环境、镜头行为和声音意图写成一条连贯提示词。若需要长篇且解释严格受控的教学叙事,应选择解说视频或矢量动画,而不是让短视频承载整堂课。

从当前能力数据选择模型

构造 video_generation 前先读取 /catalog。选定模型决定支持的任务、比例、分辨率、时长、原生音频和完成后能否多轮编辑。OpenAPI 的字段需要保持在 video_generation 内;不能使用 MCP 的扁平参数形式。除非 Catalog 明确返回支持,否则不要发送首帧、尾帧或附件字段。

创建任务、轮询 job_id,再读取完成的 creation 详情。Gemini Omni Flash 只有结果开放该动作时才可 iterate;Veo 不支持,因此实质性修改需要用新提示词创建新请求。

关联文档