什么是模型
模型是真正执行生成的 AI 系统。Get3W 把来自 25 家供应商的模型统一到一套 API 和一套寻址方案之下。
模型 Slug
每个模型都用一个三段式 slug 来定位:
{provider_id}/{model_id}/{run_type}示例:
google/nano-banana-pro/text-to-imagebytedance/seedance-2/reference-to-videominimax/music-2.6/text-to-musictripo/p1/image-to-3d
slug 同时就是请求路径,所以你要用的模型本身就是你调用的接口:
POST /v1/google/nano-banana-pro/text-to-image同一个 model_id 可以支持多种运行类型。例如 alibaba/wan-3 同时支持 text-to-video、first-to-video、first-last-to-video 和 reference-to-video —— 你选择的运行类型决定了必须提供哪些输入。
运行类型
| 运行类型 | 输入 → 输出 |
|---|---|
text-to-image | 提示词 → 图像 |
image-to-image | 图像 + 提示词 → 图像(编辑、放大、改风格) |
text-to-video | 提示词 → 视频 |
first-to-video | 首帧 + 提示词 → 视频 |
first-last-to-video | 首帧和尾帧 + 提示词 → 视频 |
reference-to-video | 参考图 + 提示词 → 视频 |
edit-to-video | 视频 + 提示词 → 编辑后的视频 |
extend-to-video | 视频 + 提示词 → 续接的新片段 |
digital-human | 人像 + 音频 → 口播数字人视频 |
text-to-speech | 文本 → 音频 |
text-to-music | 提示词 → 音乐 |
speech-to-text | 音频 → 转写文本 |
text-to-3d | 提示词 → 3D 模型 |
image-to-3d | 图像 → 3D 模型 |
text-to-panorama | 提示词 → 360° 全景图 |
image-to-panorama | 图像 → 360° 全景图 |
chat | 消息 → 文本(兼容 OpenAI) |
参考、编辑与延长
有三个运行类型都收视频作为输入,选错是最常见的问题。区别在于源视频的用途:
| 运行类型 | 源视频的作用 | duration | aspect_ratio |
|---|---|---|---|
reference-to-video | 为全新画面提供风格 / 主体参考 | 自选 | 自选 |
edit-to-video | 被就地改写的原片 | 由源视频决定,不接受传值 | 跟随源视频 |
extend-to-video | 新画面从它往后续接 | 新增片段的时长 | 跟随源视频 |
reference-to-video 完全不复用源视频画面,而是以它为参考重新生成。要改动已有片段 的内容用 edit-to-video,要保留已有片段并往后接用 extend-to-video。
延长任务有一点最容易搞错:duration 是新增片段的时长,不是延长后的成片总时长, 返回结果也只包含这段新画面,与原片的拼接需要自己做。源视频 10 秒、duration: 5 会返回 5 秒新画面,拼起来才是 15 秒。
在 Seedance 2.5 上,这三者对应同一个上游接口的三种任务模式,因此有几条约束来自 模型本身而非 Get3W:
- 编辑任务的源视频必须是 4~30 秒,超出范围会在提交时被拒绝。
- 编辑任务的输出时长恒等于源视频时长,所以不提供
duration。计费按探测到的源视频 时长计算,而不是固定 5 秒。 - 延长任务的
duration可在 4~30 秒之间指定,对应新增片段的时长。 - 编辑与延长都保持源视频的画面比例,
aspect_ratio会被忽略。 - 只要输入里含视频,计费口径就是(源视频时长 + 输出时长),所以源视频越长越贵, 哪怕只生成几秒新画面。
提示词要按所选任务的口吻写 —— 编辑写「把视频里的汽车去掉」,延长写「镜头继续向后 拉远」。模型会拿提示词与运行类型交叉核对,两者矛盾时整个任务直接失败。
供应商
模型来自 Alibaba、Anthropic、Bilibili、Black Forest Labs、ByteDance、ElevenLabs、Google、Ideogram、JD、Kling、Lightricks、Midjourney、MiniMax、OpenAI、PixVerse、Recraft、Runway、SkyReels、Tencent、Topaz、Tripo、Vidu、xAI、Ace Step,以及 Get3W 自研模型。
slug 里的 provider_id 标识的是模型的出品方,而不是承载它的基础设施。同一个 slug 可以由多个上游平台提供服务,Get3W 会在单个任务内部在它们之间自动切换 —— 详见 Get3W 工作原理。
通道
很多模型支持在请求体中传入 channel 来选择服务档位:
{
"prompt": "A sunset over mountains",
"channel": "stable"
}通用的取值:
| 通道 | 取舍 |
|---|---|
economy | 最便宜,适合批量任务 |
stable | 速度与稳定性兼顾 |
official | 直连官方供应商 |
部分模型系列使用自己的取值 —— 例如 Ideogram 用 turbo / balanced / quality,Vidu 用 turbo / pro,Lightricks 用 pro / fast,有真人链路的模型则用 standard / human。不传 channel 时,Get3W 会套用该模型的默认值。
通道会影响价格、延迟以及哪些上游供应商可用,所以在固定用某个通道之前值得先做对比测试。
参数
每个模型都有自己的输入结构。以下是跨模型高频出现的参数:
| 参数 | 说明 | 常见适用范围 |
|---|---|---|
prompt | 对输出内容的文字描述 | 大多数模型 |
image_url / image_urls | 输入图像 | 图像和视频模型 |
video_url / video_urls | 输入视频 | edit-to-video、extend-to-video、reference-to-video |
aspect_ratio | 输出画面比例,如 16:9 | 图像和视频模型 |
resolution | 输出分辨率,如 1k、720p | 图像和视频模型 |
duration | 视频时长(秒) | 视频模型 |
output_format | 文件格式,如 png | 图像模型 |
seed | 用于复现结果的随机种子 | 很多模型 |
channel | 服务档位 | 支持的模型 |
提示
参数名称、可选值和默认值因模型而异。每个模型在 get3w.com/models 上的页面都会列出完整结构。传入不支持的值时,任务结果会返回 1401 Invalid Parameter。
价格
价格取决于模型、通道以及输出特征(如分辨率和视频时长)。你的账户等级还能按模型进一步打折。每个请求在入队前都会先计价并校验余额,余额不足的调用会以 402 快速失败,而不会先执行再透支。详见计费机制。
查找模型
在 get3w.com/models 可以带筛选条件浏览完整目录。每个模型页面都会展示它的 slug、支持的运行类型、通道、参数和价格。
对于 chat 模型,另有一个兼容 OpenAI 的列表接口:
curl "https://api.get3w.com/v1/models" \
-H "Authorization: Bearer YOUR_API_KEY"它只返回 chat 模型,与 OpenAI 客户端对 /v1/models 的预期一致。生成类模型不包含在内 —— 这些请到官网的模型目录查看。