Claude 使用手册
独立第三方资料站 · 非 Anthropic / Claude 官方网站查阅条件,核对证据
API 开发

Claude API 如何计费:Token、缓存、批处理与成本核对

按实际用量分项计算输入、缓存和输出费用,再用质量达标的任务比较优化收益。

Token 不是固定数量的汉字

Token 是模型处理内容的单位,同样字数在不同语言、标点、代码和模型分词方式下可能不同。不要固定使用“一个汉字等于两 token”预算。输入还包括 system、历史、工具定义及适用的文件内容;多轮里之前的回答若再次发送,也会成为后续输入。

先识别使用渠道与计价项目

聊天订阅与 API 分开计费,直接 API 与云平台渠道也可能有不同账单规则。查看当前模型、币种、每百万 token 单价、缓存写入/读取、适用工具费用和特殊模式。价格表应标核验日期,不能把历史文章的报价当永久合同。

普通无缓存文本基础费用为输入量乘输入单价加输出量乘输出单价,再除以一百万。有缓存时 input_tokens、cache_creation_input_tokens、cache_read_input_tokens 各属不同输入类别,不要将总输入再重复加一次缓存。以官方 usage 和账单归集为准。

一个明确假设的算账例子

假设普通输入1,000、缓存写入2,000、缓存读取5,000、输出400 token;假设每百万对应单价分别是3、4、0.3、15美元。费用为0.0185美元。下面代码是算术教学,不是当前任何模型报价,也未加入工具、税费或其他附加项目。

python · 示例
from decimal import Decimal

def estimate_cost(usage, rates):
    keys = ("input_tokens","cache_creation_input_tokens",
            "cache_read_input_tokens","output_tokens")
    total = Decimal(0)
    for key in keys:
        amount = usage.get(key,0)
        if type(amount) is not int or amount < 0:
            raise ValueError("invalid_usage")
        total += Decimal(amount) * Decimal(rates[key])
    return total / Decimal(1_000_000)

sample = {"input_tokens":1000,"cache_creation_input_tokens":2000,
          "cache_read_input_tokens":5000,"output_tokens":400}
rates = dict(zip(sample, ["3","4","0.3","15"]))
assert estimate_cost(sample,rates) == Decimal("0.0185")
离线费用公式断言通过;假设单价仅演示分项计算。

生成前估算,生成后核对

用官方 token counting 检查真实请求形状,记录与生成时一致的模型、系统说明、工具和消息。计数结果用于输入规划,输出仍需预算与实际生成验证;某些处理开销或特性可能使最终用量不同。不能称字符估算是“精确 token”。

每个请求保存请求 ID、模型、计价版本、usage、状态和重试关系;对流式请求等最终消息再结算。超时后的服务端处理可能不明,应核对记录和账单,不能依据“客户端报错”断言一定免费或一定收了两次。

降低费用的实际顺序

先去掉无关上下文和重复请求,明确输出长度;然后用质量评测选择合适模型。固定长前缀可评估提示缓存,但首次写入、有效期和命中率都影响收益;低复用任务不一定受益。非实时任务可比较批处理,官方文档有相应 token 折扣,但不能扩大成所有费用统一打折。

长对话摘要和检索都要保留任务约束、权限和证据;压缩造成返工反而增加每个成功任务费用。不要把多项优化的宣传百分比直接相加。

控制超支与验收

组织支出上限之外,应用还应有每用户预算、并发预留、总截止时间和有限重试。日终比较本地估算与控制台账单,调查模型渠道、缓存类别、额外工具、时区汇总及延迟更新等差异。用同一批合格任务比较总成本与人工返工,不承诺普遍省下60%或80%。

核验日的具体型号价目与范围

截至2026年10月4日,官方价目仍列出旧页涉及的三款型号:Opus 4.6普通输入/输出为5/25美元,Sonnet 4.6为3/15美元,Haiku 4.5为1/5美元,单位均是每百万token。这里核对这些具体版本的费率,不将它们称为各家族最新型号,也不保证所有账户或渠道均可调用。

上述是Claude直接API标准基础价。示例不含缓存、服务端工具、税费、地区或特殊模式加价。假设Sonnet 4.6实际用量为500万普通输入及200万输出token,基础费是5×3+2×15=45美元;这是明确用量的算例,不是按每天使用小时数猜出的账单。

以Sonnet 4.6计算缓存收益

对Sonnet 4.6,5分钟缓存写入为每百万3.75美元,1小时写入6美元,命中读取0.30美元;这些分别是其基础输入价的1.25、2和0.1倍。0.1倍不能推广到所有新型号,也不能解释为整次请求或整月费用减少90%。

教学例:相同10000-token前缀连续使用10次,首次写入5分钟缓存,随后9次确实命中。该前缀费用为10000×3.75÷100万+9×10000×0.30÷100万=0.0645美元;无缓存是0.30美元。新消息、输出及额外收费另计,任何未命中或重新写入都会改变结果。

缓存启用后仍要检查实际命中

可以在请求顶层设置cache_control,让系统自动管理断点;也可在内容块设置显式断点。自动管理不等于没有配置就保证缓存。缓存需要相同的完整前缀;直接API中Sonnet 4.6最低1024 token,Opus 4.6和Haiku 4.5均最低4096 token,不能统一套用1024。

5分钟或1小时TTL从写入或读取请求开始计时,命中会刷新;生成耗时也占用窗口。以上算例假设先等首次响应开始,再让后续请求及时复用。检查cache_creation_input_tokens与cache_read_input_tokens,不能从HTTP成功判断命中。若混用两种TTL,写入部分需按usage.cache_creation下的ephemeral_5m_input_tokens和ephemeral_1h_input_tokens分别计价。

批处理折扣及不能省略的状态处理

Message Batches的模型token价相对标准API折半:Sonnet 4.6普通输入/输出为每百万1.50/7.50美元。前述500万输入和200万输出在无缓存、无额外项目且全部成功完成的相同用量假设下为22.50美元。它是异步处理,不适合即时聊天,也不是所有外部工具、人工成本都打五折。

每批最多100000个请求或256 MB,先达到哪个就受哪个限制。24小时是到期窗口,不是保证所有请求成功的承诺;要按custom_id关联结果,分别处理succeeded、errored、canceled、expired,不依赖返回顺序。批处理并发还可能略超工作区支出上限,应用应预留预算。

缓存与批处理折扣可以叠加,但异步并发下的缓存命中仅尽力而为;不要简单把90%与50%相加。先按实际普通输入、两类缓存写入、缓存读取及输出分项,再用适用批处理费率结算。

模型分流先验收再计算

旧页把70%任务交给Haiku 4.5、20%给Sonnet 4.6、10%给Opus 4.6后承诺省60%,该结论不保留。即使额外假设每类任务的输入和输出token量完全相同、无返工,按上述价目加权也只是每百万输入1.8美元、输出9美元,比全用Sonnet 4.6低40%。真实节省还会被不同token消耗、失败重试与人工复核改变。

因此先确认每条路线达到同一验收标准,再比较每个合格任务的总费用。本文也不保证新账户固定赠金、免绑卡或赠金永不过期;开户时应核对账户实际显示的资格与条款,不拿旧优惠描述做预算。

参考来源

资料核对日期:2026-10-04。涉及产品与账户条件时,请以当前官方说明为准。