平台概念
计费
多维计费模型:token / cache / reasoning
平台按模型 + 维度计费,不同能力用不同计量单位。每次调用的实际用量记录在用量日志与账单。
计费维度
| 维度 | 适用能力 | 说明 |
|---|---|---|
input_token / output_token | 对话 / 嵌入 / 推理 | 文本 token,最常见 |
cache_read | 对话 | 命中缓存的输入,单价更低 |
cache_write_5m / cache_write_1h | 对话 | 写入显式缓存 |
thinking / reasoning | 推理模型 | 思考链 token |
价格结构
每个模型的牌价包含 input_price / output_price(每百万单位,美元),billing_unit 当前为 token。计费公式:
cost = Σ (单位用量 × 对应维度单价)- 文本对话:
input_tokens × input_price + output_tokens × output_price(每百万) - 缓存命中:
cached_tokens × cache_read_price(单价更低) - 推理:
reasoning_tokens × output_price
扣费时点
- 预扣:请求进入时按估算输入量预扣(
input_cost),保证余额充足。 - 结算:响应返回后按真实
usage(输入+输出)结算,多退少补。
用量明细在控制台「用量 / 账单」查看,按模型、维度、时间可下钻。缓存命中部分按更低的 cache-read 单价计。