Claude 使用手册
独立第三方资料站 · 非 Anthropic / Claude 官方网站查阅条件,核对证据
使用指南

Claude 模型怎么选:Haiku、Sonnet、Opus 的任务评测与成本计算

用相同样例比较模型质量、延迟和总费用,建立可回滚的路由策略,避免把版本与价格写死。

先定义成功,再比较档位

Haiku、Sonnet、Opus 是模型系列,不是永远固定的版本和参数表。官方目录会更新,也可能出现其他系列。本文讨论这三个系列的选型方法;当前可用 ID、上下文、输出限制、参数支持和渠道价格,应以部署时的官方目录与账号权限为准。聊天界面的订阅选择与 API 模型路由是两件事。

可以把 Haiku 作为短分类和简单提取的候选、Sonnet 作为通用工作负载候选、Opus 作为复杂推理和多步骤任务候选,但这些只是起始实验,不是性能保证。小模型通过验收就可选;大模型也可能在缺少证据时出错。

做一份可以复跑的评测集

例:售后工单分为物流、退款、技术和无法判断。准备经过脱敏的常规样例、混合诉求、方言缩写和恶意指令,另留一批未用于调提示词的验证样例。给每条记录标准标签与必须转人工的条件;不要由待比较的模型独自给自己打分。

固定提示词、上下文和输出 schema,分别记录分类正确率、错误退款建议数、格式通过率、首次响应及完整响应耗时、实际 token 和重试数。对严重错误单独设门槛,不让平均分掩盖风险。报告样本数、测试日期和接口渠道;没有实测,就不写延迟和提速百分比。

费用算式必须写清单位

普通文本调用的基础估算是:请求数 ×(平均输入 token × 输入每百万 token 单价 + 平均输出 token × 输出每百万 token 单价)÷ 1,000,000。缓存写入、缓存读取、批处理、工具、不同上下文档位和重试需要另列,不能混成一个单价。

下面使用完全假设的单价演示算术:每月 10,000 次、输入 1,000 token、输出 200 token,假设每百万输入 3 美元、输出 15 美元,基础费用是 60 美元。这不是任何当前套餐报价;使用时替换为适用渠道真实价格与实际 usage。

python · 示例
from decimal import Decimal

def estimate_usd(calls, input_tokens, output_tokens, input_rate, output_rate):
    return (Decimal(calls) *
            (Decimal(input_tokens) * Decimal(input_rate) +
             Decimal(output_tokens) * Decimal(output_rate)) /
            Decimal(1_000_000))

assert estimate_usd(10000, 1000, 200, "3", "15") == Decimal("60")
本地断言通过;假设价格示例,不调用 API。

分流要有明确升级条件

先从已通过验收的默认模型开始。对“分类结果无法判断”或规则校验失败的请求,可安排更强候选复核;涉及付款、个人权益或缺少知识库证据时,转人工比无条件升级更合适。升级最多一次还是允许多次,应由预算和任务要求规定。

路由配置要记录任务类型、模型 ID、提示版本、阈值和回滚目标。不能把未校准的模型自报置信度当成唯一依据,也不能假定不同模型的工具和历史内容块完全兼容。把回退后仍失败、费用翻倍和供应商不可用加入测试。

上线前最后核对

选择满足质量门槛且总体成本可接受的方案,而不是只选单次单价最低的模型。先用小流量验证真实分布,观察升级比例、人工介入与每个成功任务的成本,再扩大使用。模型升级或退役时重跑同一评测集,旧榜单分数不能替代你自己的验收。

参考来源

资料核对日期:2026-10-04。涉及产品与账户条件时,请以当前官方说明为准。