AI 视频
AI 视频使用 ai_video。创建前读取 generation_models[],不要按模型创建不同 endpoint 或 type。
Gemini Omni Flash
{ "type": "ai_video", "prompt": "镜头缓慢穿过雨夜未来城市,霓虹倒映在街道上,保留自然环境声", "aspect_ratio": "16:9", "video_generation": { "model": "gemini-omni-flash", "task": "text_to_video", "resolution": "720p", "duration_seconds": 8, "native_audio": true }}
Omni 支持 iterate 多轮编辑,调用方不需要管理 interaction ID。
Veo 3.1 Fast
{ "type": "ai_video", "prompt": "一架纸飞机穿过明亮的现代图书馆,电影感运镜", "aspect_ratio": "16:9", "video_generation": { "model": "veo-3.1-fast", "task": "text_to_video", "resolution": "720p", "duration_seconds": 8, "native_audio": true }}
Veo 3.1 Standard
{ "type": "ai_video", "prompt": "日出时分的海岸科研站,缓慢推进镜头,真实环境声", "aspect_ratio": "16:9", "video_generation": { "model": "veo-3.1-standard", "task": "text_to_video", "resolution": "720p", "duration_seconds": 8, "native_audio": true }}
Veo 不支持多轮编辑。当前 Public OpenAPI 仅开放文本生成,首帧、尾帧和附件暂不接受;以 Catalog 返回能力为准。
为运动优先的内容选择 AI 视频
短时动态画面、产品氛围、电影感 B-roll,或需要由运动和声音传达重点的概念,适合使用 AI 视频。将主体、动作、环境、镜头行为和声音意图写成一条连贯提示词。若需要长篇且解释严格受控的教学叙事,应选择解说视频或矢量动画,而不是让短视频承载整堂课。
从当前能力数据选择模型
构造 video_generation 前先读取 /catalog。选定模型决定支持的任务、比例、分辨率、时长、原生音频和完成后能否多轮编辑。OpenAPI 的字段需要保持在 video_generation 内;不能使用 MCP 的扁平参数形式。除非 Catalog 明确返回支持,否则不要发送首帧、尾帧或附件字段。
创建任务、轮询 job_id,再读取完成的 creation 详情。Gemini Omni Flash 只有结果开放该动作时才可 iterate;Veo 不支持,因此实质性修改需要用新提示词创建新请求。
