OpenRouter 上线视频生成 API,统一接入 Seedance、Veo、Wan、Sora
Announcing Video Generation
OpenRouter 上线视频生成功能,用一个 API 接入多家视频模型,与文本、图像、音频等共用同一套路由、治理和计费层。首日支持 Seedance 2.0 / 1.5、Veo 3.1、Wan 2.7 / 2.6 和 Sora 2 Pro 的文生视频与图生视频,采用异步任务模式,并提供归一化参数、能力发现和 passthrough 参数。
原文给出统一视频生成 API 的模型清单与参数归一化方案,可据此判断多模型接入的工程成本。
视频生成功能现已在 OpenRouter 上线。一个 API 即可让你访问顶级视频模型。视频现在与文本、图像、音频、嵌入和重排序器并列,处于同一套路由、治理和计费层之下。
上线首日,我们支持 Seedance 2.0 / 1.5、Veo 3.1、Wan 2.7 / 2.6 和 Sora 2 Pro 上的文生视频和图生视频,后续还会有更多。 浏览所有支持的模型,了解更多关于该功能的信息,或直接跳转到新的 /api/v1/videos 的 API 文档。
视频 API 目前支离破碎。各家提供商使用不同的请求结构、参数名称和计费单位。我们围绕这些差异构建了 API:
- 异步生成:这些生成需要数分钟,因此我们将其作为任务来跟踪。提交提示词,获取任务 ID,并在视频就绪时取回。
- 规范化参数:我们提供一套适用于所有模型的统一 schema,包括分辨率、时长、宽高比、音频生成、帧图像和参考图像。
- 能力发现:在调用之前,以编程方式确定每个模型支持哪些能力。
- 透传参数:在需要时直接使用模型特有的功能。
一个统一 API
视频模型通常以一系列端点家族的形式发布。每个端点提供特定能力,例如文生视频、图生视频或参考生视频。我们通过根据你的参数自动路由到正确的端点来简化这一过程。
视频模型的差异往往并不明显。甚至 duration 也很容易让请求失败。Veo 3.1 支持 4、6 或 8 秒的片段,而 Wan 2.6 支持 5 或 10 秒的片段。我们还统一了传入参考图像(例如角色)和帧图像(例如首帧和末帧)的方式。
每个模型还可以暴露自己的功能。例如,Veo 3.1 包含一个独特的 personGeneration 参数,用于控制输出中是否出现人物。/api/v1/videos/models 端点会准确告诉你有哪些模型特有的参数可用。
无需自己跟踪所有这些差异,你可以调用 video models 端点,在一个地方查看支持的分辨率、宽高比、定价、输入图像和时长:/api/v1/videos/models。这是一个非常适合交给你的编码代理的端点,提供它所需的所有细节,以便适配每个模型,而不必为可接受的输入参数反复与错误作斗争。
为了便于直观预览,我们还在模型页面上新增了 Playground 标签页,让你可以试用每个模型并查看它能生成什么。
多模态工作流
最令我们兴奋的是将视频与其他类型的生成结合起来时所看到的结果。LLM 可以把粗略的想法变成详细的提示词,图像模型可以生成主角,视频模型可以把那个角色变成一个场景,全部通过一个 API 完成。
我们很快了解到,这些模型会奖励具体性。镜头运动、光照、纹理、节奏、运动风格,所有这些都很重要。你提供的细节越多,获得的控制力就越强。这使得视频生成天然适合由 LLM 生成的提示词。
我们构建了一个开源演示应用,展示这种多模态工作流的实际效果:multimedia-explorer.openrouter.ai。所有代码都在 GitHub 上。
在 Discord 的 #video-feedback 中告诉我们你的想法以及你接下来想要哪些模型。感谢所有测试 alpha 版并帮助塑造 API 的人。如果你想提前体验接下来的内容,加入我们的 Discord。
来源:OpenRouter Blog · openrouter.ai