如何选择合适的模型
一份帮你为具体场景挑出最合适模型的指南。
决策框架
1. 确定任务类型
| 任务 | Run type | 优先试试 |
|---|---|---|
| 生成图像 | text-to-image | Nano Banana Pro、Seedream 5 Pro |
| 编辑图像 | image-to-image | Nano Banana Pro、Qwen Image 2 |
| 生成视频 | text-to-video | Veo 3.1、Kling 3、Seedance 2.5 |
| 图片转动画 | first-to-video | Kling 3、Veo 3.1、Wan 3 |
| 语音合成 | text-to-speech | ElevenLabs Eleven 3、Index TTS 2 |
| 生成音乐 | text-to-music | Minimax Music 2.6、Eleven Music |
| 音频转文字 | speech-to-text | Whisper Large v3 Turbo |
| 数字人口播 | digital-human | OmniHuman 1.5、Kling Avatar 2 |
| 生成 3D 模型 | image-to-3d | Tripo P1、Tripo H3.1 |
| 对话 | chat | GPT-5.5、Claude Opus 4.7 |
run type 是模型 slug 的第三段,因此它也决定了你要调用的接口地址。
2. 权衡质量与速度
同一模型家族通常会提供多个变体,后缀就说明了它的取舍:
| 关注点 | 选什么 |
|---|---|
| 质量最高 | -pro 变体 —— 更慢、更贵 |
| 兼顾平衡 | 不带后缀的基础模型 |
| 速度最快 | -fast / -turbo 变体 |
| 成本最低 | -lite / -mini 变体 |
如果模型提供了 channel,那它就是同一取舍上的第二个旋钮:economy 比 stable 便宜,stable 又比 official 便宜。很多时候换个 channel 就够了 —— 未必需要换模型。
3. 考虑分辨率
分辨率和时长是最主要的成本乘数,所以不要为超出实际用途的规格付费:
| 输出 | 常用设置 | 适用场景 |
|---|---|---|
| 草稿图 | 1k | 提示词迭代 |
| 成品图 | 2k 及以上 | 印刷、大屏展示 |
| 草稿视频 | 480p | 检查构图 |
| 标准视频 | 720p | 网页与社交媒体 |
| 高品质视频 | 1080p | 正式交付 |
各模型支持的取值不同 —— 具体请查看模型页面。
用实测数据对比模型
与其依赖一份固定的排行榜,不如用你自己的提示词实测。返回的结果对象已经包含了你需要的信息:
timings.api_call—— 真正花在供应商侧的时间,这才是公平的延迟对比口径- 每次任务的成本 —— 可在控制台中按请求查看
用固定的 seed 把同一条提示词跑在两三个候选模型上,然后结合上面两个数字比较输出质量。
小技巧
- 先便宜,再迭代 —— 用快速、低成本的模型或
economychannel 出草稿,最终渲染时再换档 - 看模型页面 —— 每个模型都列出了自己的参数、channel 和价格
- 对比时固定 seed —— 否则你比的是两个随机样本,而不是两个模型
- 先用网页端试 —— 评估模型时比现搭 API 调用快得多
下一步
- 如何写出更好的提示词 —— 提升生成效果
- 如何降低成本 —— 优化开销