截至2026年10月9日,Anthropic 官方列出的 Claude Haiku 5.5 API 标准价格为:提示词不超过100,000 token 时,输入每百万 token 0.10美元、输出每百万 token 0.50美元;提示词超过100,000 token 时,分别为0.50美元和2.50美元。下面按官方价格说明输入、输出如何计费,以及怎样估算单次和月度成本。实际账单应以调用平台当时的计费规则和用量记录为准。
Claude Haiku 5.5 的 API 价格是多少?
Anthropic 模型文档列出的型号 ID 是 claude-haiku-5-5。截至上述核查日期,API 价格如下。金额为美元,单位 MTok 指一百万 token。
| 计费项目 | 提示词不超过100,000 token | 提示词超过100,000 token |
|---|---|---|
| 输入 token | $0.10 / MTok | $0.50 / MTok |
| 输出 token | $0.50 / MTok | $2.50 / MTok |
| 5分钟提示词缓存写入 | $0.125 / MTok | $0.625 / MTok |
| 1小时提示词缓存写入 | $0.20 / MTok | $1.00 / MTok |
| 缓存读取 | $0.01 / MTok | $0.05 / MTok |
官方文档还列出 Message Batches API 的输入与输出价格为标准价格的50%。这项说明针对批处理 API,不应直接套用到普通的逐条请求;也不要假定批处理折扣可以与其他计费机制叠加。本文价格核查日期为2026年10月9日,后续调用前建议再查看官方模型价格页。
API 账单如何区分输入和输出 token?
输入 token 是模型处理请求时收到的内容,包括系统提示、用户消息、传入的对话历史,以及请求中包含的工具定义或工具结果等;输出 token 是模型生成的内容。启用思考功能时,官方文档说明思考 token 按输出 token 计费。因而,不能只按“发了几条消息”估成本:一条很长的上下文可能比多条短请求消耗更多 token。
基础估算公式是:
费用 = 输入 token 数 ÷ 1,000,000 × 输入单价 + 输出 token 数 ÷ 1,000,000 × 输出单价
如果使用缓存或批处理,需按各自适用的官方单价单独核算。不同计费类别不能一概按普通输入价格计算。多轮对话也要留意请求中是否重复带上了前文;传入的历史内容会增加输入用量。API 返回的 usage 用量信息可用于复核实际 token 数。
怎样估算一次调用和每月成本?
以一个明确标为假设的场景为例:提示词共20,000个输入 token,模型生成3,000个输出 token,且提示词不超过100,000 token。输入费用是20,000 ÷ 1,000,000 × $0.10 = $0.002;输出费用是3,000 ÷ 1,000,000 × $0.50 = $0.0015。两项合计约$0.0035。这里没有计入缓存、批处理或其他渠道费用,也不是对所有请求的用量预测。
若每月调用1,000次,并且每次都恰好达到上述假设用量,估算为$0.0035 × 1,000 = $3.50。实际工作负载往往每次输入和输出长度不同,更稳妥的做法是抽取一批真实任务,记录每次请求的输入、输出用量,再按月调用次数外推。可以用下面的公式替换自己的数据:
月度标准成本 = 月输入 token 总数 ÷ 1,000,000 × 输入单价 + 月输出 token 总数 ÷ 1,000,000 × 输出单价
如果请求提示词超过100,000 token,应先核对该提示词对应的价格档位;不能因为模型支持较长上下文,就按普通档位估算。Anthropic 的模型资料注明,Haiku 5.5 的上下文窗口为1M token,同时说明超过100,000 token 的提示词价格较高。上下文容量与收费档位是不同问题,不应把“能传入”理解成“仍按低价计费”。
缓存和批处理会怎样影响费用?
如果请求中反复出现相同内容,可以研究是否适合使用提示词缓存。官方价格表分别列出了5分钟、1小时缓存写入和缓存读取价格,且都与普通输入价格不同。具体能否缓存、缓存如何设置以及请求是否符合条件,应按当前缓存文档核实;不能把全部输入 token 都假定为缓存读取,也不能在没有实际缓存用量数据时先按低价预算。
对于适合异步批量处理的任务,官方模型页列明 Message Batches API 的输入和输出有50%折扣。使用前要确认任务能接受批处理方式及相应处理流程。普通 Messages API 调用不能仅凭任务量大就按批处理价格估算。
API 费用和 Claude 订阅费是一回事吗?
不是同一笔计费。通过 Claude Platform 调用 API,费用按 API 使用量计算;Claude 应用的订阅权益不能简单等同于一笔 API 预付款。不过,核查到的 Anthropic 支持资料说明,符合条件的部分 Max 和 Team 计划可以申领 Claude Platform 月度 API credits,并关联到一个 Console 组织使用。因此,也不能笼统地说所有订阅都绝不包含 API 额度。资格、额度与使用范围可能调整,是否适用应查看自己的计划和官方账单说明;云平台渠道的账单规则也可能不同。
怎样控制 Haiku 5.5 的调用预算?
- 先测真实任务。选取有代表性的短文本、长上下文和多轮任务,记录各类请求的输入与输出 token,不用消息条数代替用量。
- 检查请求是否重复携带材料。只保留完成任务所需的上下文;确实需要反复使用同一段内容时,再评估缓存是否适用。
- 给月度调用量留出余量。以实际样本的用量分布估算,而不是只拿最短的一次请求推算整月费用。
- 查看账单和组织限额。Anthropic Console 的账单页面可查看 API 用量及设置可用的支出限额;官方资料说明,达到限额可能导致请求暂停。若通过云平台或其他渠道调用,应核对该渠道自己的账单和限额设置。
- 把重试和批量任务纳入监控。自动重试、重复提交或批量任务都可能增加实际请求量。记录请求结果和 usage,及时发现与预估不符的情况。
简而言之,Claude Haiku 5.5 的普通 API 费用主要由输入与输出 token 数决定:输入便宜于输出,但提示词超过100,000 token 时,官方列出的两项单价都会上调。预算较小时,先用实际任务测出 token 用量,再按对应价格档位计算,并将缓存、批处理和 API credits 分开核对,比只看每次请求的粗略平均数更可靠。
