AI Gateway 计费说明
本文介绍云器 AI Gateway 国内区(人民币计价)模型的计费方式、价格口径、缓存计费规则和国内模型列表价。价格用于帮助用户在接入前估算成本,实际费用请以 模型广场详情页、用量统计页面和最终账单 为准。
价格来源参考产品价格配置表与模型广场展示口径。本文仅采用国内人民币(RMB)列表价;飞书表格中的美元(USD)价格不纳入本章。模型市场价格可能随供应商、模型版本、接入点、区域和产品策略调整。
我该看哪张表
如果只想快速确认某类模型怎么计费,可以按下表选择阅读位置。
| 使用目标 | 建议查看 |
|---|---|
| 调用 Qwen、DeepSeek、GLM、Kimi、MiniMax、豆包文本模型 | 查看 和对应模型系列价格表。 |
| 想知道缓存为什么更便宜 | 查看 。 |
| 使用 HappyHorse 视频模型 | 查看 ,该系列按秒计费。 |
| 使用豆包 Seedance 视频模型 | 查看 ,该系列按百万 Tokens 计费。 |
| 使用豆包 Seedream 图片模型 | 查看 。 |
| 使用 3D 生成模型 | 查看 。 |
| 使用 Embedding / 向量模型 | 查看 。 |
| 想估算一次调用大概多少钱 | 查看 。 |
| 想核对实际账单 | 查看 。 |
价格口径
| 口径 | 说明 |
|---|---|
/ | 本文列出的公开价格口径,用于成本估算和模型选型。 |
| 模型广场可能展示客户折扣后的价格,实际以页面和账单为准。 |
| 最终出账使用的价格,可能受折扣、接入点、BYOK、供应商账单周期等因素影响。 |
| 使用平台内置供应商产生的费用,可在用量统计中查看。 |
| 使用用户自有云厂商 Key 产生的费用,通常由用户在云厂商侧结算。 |
计费方式
AI Gateway 按需计费。调用模型 API 时,系统按当次实际消耗的 Tokens、时长、张数或任务量累计计费。
| 特性 | 说明 |
|---|---|
| 无最低消费门槛,按实际调用量计费。 |
| 每次模型调用都会记录请求量、Token、计费量和成本。 |
| 可在用量统计中按 API Key 查看具体业务消耗。 |
| 可在用量统计中查看各模型的请求数、Token 和费用。 |
| 账单通常按月汇总,最终金额以账单为准。 |
Token 与缓存计费
文本模型 Token 计费
按 Token 计费的对话模型通常区分
输入 和 输出:
| 字段 | 含义 |
|---|---|
| 用户请求中 prompt、messages、上下文等输入内容的 Token 单价。 |
| 模型生成内容的 Token 单价。 |
| 部分模型按上下文窗口分段计价,长上下文可能对应更高单价。 |
文本模型费用通常按以下公式估算:
示例:输入 1,000 tokens,输出 2,000 tokens;输入价 2 元/M Tokens,输出价 8 元/M Tokens:
缓存能省多少钱
如果业务反复发送相同的长系统提示词、知识库文档或固定上下文,模型可以复用已处理过的前缀内容,这就是缓存。缓存命中的单价通常低于普通输入价,因此适合长 Prompt、多轮对话和 Agent 工作流。
缓存主要分为两类:
| 类型 | 工作方式 | 价格表字段 |
|---|---|---|
| 用户或接口主动声明要缓存某段内容。首次写入可能收取写入费,后续命中按较低命中价计费。 | 、、 |
| 系统自动识别重复前缀并复用,无需用户显式声明。 | |
各列含义:
| 字段 | 说明 |
|---|---|
| 首次把一段 Prompt 写入缓存时收取。 |
| 后续请求命中显式缓存时收取。 |
| 系统自动识别重复内容并命中时收取。 |
| 部分模型会对缓存内容按存储时长收取费用。 |
厂商缓存支持情况
| 厂商 / 模型族 | 显式缓存 | 隐式缓存 |
|---|---|---|
| 支持 | 部分支持,3.5 系列支持;3.6 / 3.7 系列暂未提供。 |
| 部分支持,v3.2 支持。 | 部分支持,v3.2 / v4-flash / v4-pro / r1 支持。 |
| 部分支持,5.1 支持。 | 支持。 |
| 支持。 | 支持。 |
| 不支持。 | 支持。 |
| 支持,另收缓存存储费。 | 支持。 |
非文本模型计费
视频、图片、3D 和向量模型不一定按普通文本 Token 计费,接入前应先确认模型详情页中的计费单位。
| 模型类型 | 计费说明 |
|---|---|
| HappyHorse 系列按生成视频时长计费,单位为元/秒;豆包 Seedance 系列按百万 Tokens 计费,并按是否含视频输入、输出分辨率等维度分档。 |
| 豆包 Seedream 系列按百万 Tokens 计费,文生图、图生图同价。 |
| 豆包 Seed3D、Hyper3D、Hitem3D 按百万 Tokens 计费,并按白模、纹理、PBR、精度等规格分档。 |
| Qwen3 VL Embedding、豆包 doubao-embedding-vision 按输入数据类型分别计价,文本输入价格低于图片 / 视频输入。 |
国内模型列表价
以下价格单位如无特殊说明,均为
元 / 百万 Tokens。
通义千问 Qwen 系列
| 系列 | 模型名称 | 上下文窗口 | 输入 | 输出 | 显式·写入 | 显式·命中 | 隐式·命中 |
|---|---|---|---|---|---|---|---|
| Qwen Max | | 0–1M | 12 | 36 | 15 | 1.2 | 2.4 |
| Qwen Max | | 0–128K | 9 | 54 | 11.25 | 0.9 | — |
| Qwen Max | | 128K–256K | 15 | 90 | 18.75 | 1.5 | — |
| Qwen Max | | 0–32K | 2.5 | 10 | 3.125 | 0.25 | 0.5 |
| Qwen Max | | 32K–128K | 4 | 16 | 5 | 0.4 | 0.8 |
| Qwen Max | | 128K–256K | 7 | 28 | 8.75 | 0.7 | 1.4 |
| Qwen Max | | 不区分上下文 | 2.4 | 9.6 | — | — | 0.48 |
| Qwen Plus | | 0–256K | 2 | 8 | 2.5 | 0.2 | 0.4 |
| Qwen Plus | | 256K–1M | 6 | 24 | 7.5 | 0.6 | 1.2 |
| Qwen Plus | | 0–256K | 2 | 12 | 2.5 | 0.2 | — |
| Qwen Plus | | 256K–1M | 8 | 48 | 10 | 0.8 | — |
| Qwen Plus | | 0–128K | 0.8 | 4.8 | 1 | 0.08 | 0.16 |
| Qwen Plus | | 128K–256K | 2 | 12 | 2.5 | 0.2 | 0.4 |
| Qwen Plus | | 256K–1M | 4 | 24 | 5 | 0.4 | 0.8 |
| Qwen Plus | | 0–128K | 0.8 | 8 | 1 | 0.08 | 0.16 |
| Qwen Plus | | 128K–256K | 2.4 | 24 | 3 | 0.24 | 0.48 |
| Qwen Plus | | 256K–1M | 4.8 | 64 | 6 | 0.48 | 0.96 |
| Qwen Flash | | 0–256K | 1.2 | 7.2 | 1.5 | 0.12 | — |
| Qwen Flash | | 256K–1M | 4.8 | 28.8 | 6 | 0.48 | — |
| Qwen Flash | | 0–128K | 0.2 | 2 | 0.25 | 0.02 | — |
| Qwen Flash | | 128K–256K | 0.8 | 8 | 1 | 0.08 | — |
| Qwen Flash | | 256K–1M | 1.2 | 12 | 1.5 | 0.12 | — |
qwen3-vl-embedding 属于向量模型,按文本输入、图片 / 视频输入分别计费,价格见下方 向量模型价格。
MiniMax 系列
| 模型名称 | 输入 | 输出 | 隐式·命中 |
|---|---|---|---|
| 2.1 | 8.4 | 0.42 |
| 2.1 | 8.4 | 0.42 |
DeepSeek 系列
| 模型名称 | 输入 | 输出 | 显式·写入 | 显式·命中 | 隐式·命中 |
|---|---|---|---|---|---|
| 4 | 16 | — | — | 0.8 |
| 2 | 3 | 2.5 | 0.2 | 0.4 |
| 1 | 2 | — | — | 0.2 |
| 12 | 24 | — | — | 2.4 |
智谱 GLM 系列
| 模型名称 | 上下文窗口 | 输入 | 输出 | 显式·写入 | 显式·命中 | 隐式·命中 |
|---|---|---|---|---|---|---|
| 0–32K | 3 | 14 | — | — | 0.6 |
| 32K–166K | 4 | 16 | — | — | 0.8 |
| 0–32K | 4 | 18 | — | — | 0.8 |
| 32K–198K | 6 | 22 | — | — | 1.2 |
| 0–32K | 6 | 24 | 7.5 | 0.6 | 1.2 |
| 32K–200K | 8 | 28 | 10 | 0.8 | 1.6 |
| — | 8 | 28 | — | — | 1.6 |
月之暗面 Kimi 系列
| 模型名称 | 输入 | 输出 | 显式·写入 | 显式·命中 | 隐式·命中 |
|---|---|---|---|---|---|
| 4 | 21 | 5 | 0.4 | 0.8 |
| 6.5 | 27 | 8.125 | 0.65 | 1.3 |
豆包文本系列
豆包文本系列按上下文窗口区间分段计价;缓存存储按
0.017 元 / 百万 Tokens · 小时 另行计费。
Doubao Seed 2.0 系列
| 模型名称 | 上下文窗口 | 输入 | 输出 | 缓存存储 | 显式·命中 | 隐式·命中 |
|---|---|---|---|---|---|---|
| 输入长度 [0, 256K] | 6 | 30 | 0.017 | 1.2 | 1.2 |
| 输入长度 [0, 256K] | 6 | 30 | 0.017 | 1.2 | 1.2 |
| 输入长度 [0, 256K] | 3 | 15 | 0.017 | 0.6 | 0.6 |
| [0, 32K] | 3.2 | 16 | 0.017 | 0.64 | 0.64 |
| (32K, 128K] | 4.8 | 24 | 0.017 | 0.96 | 0.96 |
| (128K, 256K] | 9.6 | 48 | 0.017 | 1.92 | 1.92 |
| [0, 32K] | 0.6 | 3.6 | 0.017 | 0.12 | 0.12 |
| (32K, 128K] | 0.9 | 5.4 | 0.017 | 0.18 | 0.18 |
| (128K, 256K] | 1.8 | 10.8 | 0.017 | 0.36 | 0.36 |
| [0, 32K] | 9 | 3.6 | 0.017 | 1.8 | 1.8 |
| (32K, 128K] | 13.5 | 5.4 | 0.017 | 2.7 | 2.7 |
| (128K, 256K] | 27 | 10.8 | 0.017 | 5.4 | 5.4 |
| [0, 32K] | 0.2 | 2 | 0.017 | 0.04 | 0.04 |
| (32K, 128K] | 0.4 | 4 | 0.017 | 0.08 | 0.08 |
| (128K, 256K] | 0.8 | 8 | 0.017 | 0.16 | 0.16 |
| [0, 32K] | 3 | 2 | 0.017 | 0.6 | 0.6 |
| (32K, 128K] | 6 | 4 | 0.017 | 1.2 | 1.2 |
| (128K, 256K] | 12 | 8 | 0.017 | 2.4 | 2.4 |
| [0, 32K] | 3.2 | 16 | 0.017 | 0.64 | 0.64 |
| (32K, 128K] | 4.8 | 24 | 0.017 | 0.96 | 0.96 |
| (128K, 256K] | 9.6 | 48 | 0.017 | 1.92 | 1.92 |
Doubao Seed 1.8 / 1.6 系列
| 模型名称 | 上下文窗口 | 输入 | 输出 | 缓存存储 | 显式·命中 | 隐式·命中 |
|---|---|---|---|---|---|---|
| [0, 32K] | 0.8 | 8 | 0.017 | 0.16 | 0.16 |
| (32K, 128K] | 1.2 | 16 | 0.017 | 0.16 | 0.16 |
| (128K, 256K] | 2.4 | 24 | 0.017 | 0.16 | 0.16 |
| [0, 32K] | 0.8 | 2 | 0.017 | 0.16 | 0.16 |
| (32K, 128K] | 1.2 | 6 | 0.017 | 0.16 | 0.16 |
| [0, 32K] | 1.2 | 8 | 0.017 | 0.24 | 0.24 |
| (32K, 128K] | 1.4 | 12 | 0.017 | 0.24 | 0.24 |
| (128K, 256K] | 2.8 | 16 | 0.017 | 0.24 | 0.24 |
| [0, 32K] | 0.8 | 8 | 0.017 | 0.16 | 0.16 |
| (32K, 128K] | 1.2 | 16 | 0.017 | 0.16 | 0.16 |
| (128K, 256K] | 2.4 | 24 | 0.017 | 0.16 | 0.16 |
| [0, 32K] | 0.3 | 2.4 | 0.017 | 0.06 | 0.06 |
| (32K, 128K] | 0.6 | 4 | 0.017 | 0.06 | 0.06 |
| (128K, 256K] | 1.2 | 12 | 0.017 | 0.06 | 0.06 |
| [0, 32K] | 0.15 | 1.5 | 0.017 | 0.03 | 0.03 |
| (32K, 128K] | 0.3 | 3 | 0.017 | 0.03 | 0.03 |
| (128K, 256K] | 0.6 | 6 | 0.017 | 0.03 | 0.03 |
| [0, 32K] | 0.8 | 8 | 0.017 | 0.16 | 0.16 |
| (32K, 128K] | 1.2 | 16 | 0.017 | 0.16 | 0.16 |
| (128K, 256K] | 2.4 | 24 | 0.017 | 0.16 | 0.16 |
Doubao 其他文本模型
| 模型名称 | 上下文窗口 | 输入 | 输出 | 缓存存储 | 显式·命中 | 隐式·命中 |
|---|---|---|---|---|---|---|
| — | 1.2 | 3.6 | — | — | — |
| — | 0.8 | 2 | 0.017 | 0.16 | 0.16 |
| — | 0.3 | 0.6 | 0.017 | 0.06 | 0.06 |
| — | 3 | 9 | — | — | — |
happyhorse 视频生成系列
表中价格单位为
元 / 秒。
| 模型类型 | 模型名称 | 计费维度 | 720P | 1080P |
|---|---|---|---|---|
| 文生视频 | | 元 / 秒 | 0.9 | 1.6 |
| 图生视频(首帧) | | 元 / 秒 | 0.9 | 1.6 |
| 参考生视频 | | 元 / 秒 | 0.9 | 1.6 |
豆包视频生成系列
表中价格单位为
元 / 百万 Tokens。
| 模型名称 | 价格维度 | 价格 |
|---|---|---|
| 输出 480p / 720p · 输入不含视频 | 46 |
| 输出 480p / 720p · 输入含视频 | 28 |
| 输出 1080p · 输入不含视频 | 51 |
| 输出 1080p · 输入含视频 | 31 |
| 输出 4K · 输入不含视频 | 26 |
| 输出 4K · 输入含视频 | 16 |
| 输出 480p / 720p · 输入不含视频 | 37 |
| 输出 480p / 720p · 输入含视频 | 22 |
| 输出 480p / 720p · 输入不含视频 | 23 |
| 输出 480p / 720p · 输入含视频 | 14 |
| 有声视频 | 16 |
| 无声视频 | 8 |
| — | 15 |
| — | 4.2 |
豆包图片生成系列
表中价格单位为
元 / 百万 Tokens。
| 模型名称 | 价格维度 | 价格 |
|---|---|---|
| 输入图 · 第 2 张起 | 0.02 |
| 输出图 · ≤236 万像素 | 0.3 |
| 输出图 · >236 万像素 | 0.6 |
| — | 0.22 |
| — | 0.25 |
| — | 0.2 |
豆包 3D 生成系列
表中价格单位为
元 / 百万 Tokens。
| 模型名称 | 价格维度 | 价格 |
|---|---|---|
| 带纹理和 PBR 材质的 3D 模型 | 2.4 |
| 白模 / 带纹理 / PBR / 带纹理 + PBR | 1.8 |
| 标准白模 | 5.8 |
| 标准纹理模型 | 10.15 |
| 高精白模 | 8.7 |
| 高精纹理模型 | 13.05 |
向量模型价格
表中价格单位为
元 / 百万 Tokens。
| 模型名称 | 价格维度 | 价格 |
|---|---|---|
| 文本输入 | 0.7 |
| 图片 / 视频输入 | 1.8 |
| 文本输入 | 0.7 |
| 图片输入 | 1.8 |
计费示例
文本模型
调用
qwen3-max(0–32K 窗口),输入 10,000 tokens,输出 2,000 tokens,无缓存命中:
带显式缓存的文本模型
调用
qwen3.5-plus(0–128K 窗口),首次请求写入缓存 5,000 tokens、输出 1,000 tokens;第二次请求命中缓存 5,000 tokens、新输入 500 tokens、输出 1,000 tokens:
happyhorse 按秒视频
使用
happyhorse-1.0-t2v 生成 720P、5 秒视频:
seedance 按 Token 视频
使用
doubao-seedance-2.0 输出 1080P、不含视频输入,本次调用消耗 0.5M tokens:
图片生成
调用
doubao-seedream-5.0-lite,本次调用消耗 0.1M tokens:
向量模型
使用
doubao-embedding-vision 处理 100 万文本 tokens:
账单核对方法
如果需要核对费用,建议按以下步骤排查:
- 在 模型广场 中进入模型详情,确认模型标识、接入点和价格明细。
- 在 API KEY 管理 中确认该 Key 的路由策略,判断实际可能走哪个供应商或 BYOK。
- 在 用量统计 中按模型或 API Key 查看请求数、Token、系统成本和 BYOK 成本。
- 对比输入、输出、缓存、图片、视频或任务用量是否符合预期。
- 如果使用 BYOK,还需要到对应云厂商侧核对账单。
常见问题
为什么模型广场卡片价格和详情页价格不完全一致
模型卡片通常展示起步价或最低价;详情页会按接入点展示更完整的价格。接入前应以模型详情页
接入点管理 中的价格明细为准。
为什么同一模型有多个价格
同一模型可能按上下文窗口、输入类型、输出分辨率、端点、渠道或缓存命中方式分档计价。实际费用取决于当次请求命中的具体计费维度。
BYOK 是否按本文价格计费
BYOK 调用使用用户自有云厂商 Key,费用通常由用户在云厂商侧直接结算。AI Gateway 页面中的价格和成本展示可用于参考,但最终仍应以云厂商账单为准。
如何降低模型调用成本
- 优先选择符合任务复杂度的模型,不要所有场景都使用最高规格模型。
- 对重复长 Prompt、知识库上下文和 Agent 工作流使用缓存能力。
- 使用 API Key 限额和金额限额控制异常调用风险。
- 在用量统计中定期查看高消耗模型和高消耗 API Key。
- 对视频、图片、3D 等非文本模型,先确认计费单位和任务规格。
