Claude 使用手册
独立第三方资料站 · 非 Anthropic / Claude 官方网站查阅条件,核对证据
模型比较

Opus 4.6、GPT-5.4、Gemini 3.1 Pro:2026年3月版本对照与现行核验

保留三款具体模型的历史对照,重核时间、输入规格和价格,用可复查任务取代终极排名。

这是一组历史版本,不是当前总榜

本页原发布于2026年3月23日,现于10月4日重新核验。Opus 4.6发布于2月5日,Gemini 3.1 Pro模型卡发布于2月19日,GPT-5.4发布于3月5日。不能把这三者都说成二月十四天内发布,也不能将后来型号的能力倒填到这些名称下。

三者在当时都面向复杂任务,但发布公告是供应商说明,不是同条件盲测。原稿的写作、代码、推理“第一名”和自主工作时长缺少统一可复查记录,本次不再据此分配赢家。

输入能力与容量要按字段看

Gemini 3.1 Pro模型卡列文本、图像、视频、音频等输入,开发者端点仍标Preview,输入上限1,048,576、输出65,536。GPT-5.4模型页列文本/图像输入、文本输出,1,050,000上下文与128,000最大输出。不能把产品里转写/视频能力直接归给这个API型号。

Opus 4.6发布时介绍1M上下文beta;当前Claude计价页已说明4.6及以后型号的1M标准费率条件,使用时还要核对渠道支持。原稿“Gemini2M稳定、GPT只有Codex模式才1M”的简单结论不保留;容量也不等于材料中的每条事实都能被可靠找到。

2026年10月核验的普通API费率

每百万输入/输出token:Opus 4.6为5/25美元;GPT-5.4为2.50/15美元;Gemini 3.1 Pro Preview在提示不超过200k时为2/12美元,超过时为4/18美元。GPT-5.4也有超过272K输入的长上下文计价条件。所有数字须与服务模式、渠道及当前文档一起使用。

原创算例:假设10个请求,每个恰好100k输入和20k计费输出token,均不触发上述长输入档,无缓存或额外工具费用。三者基础总额分别为10、5.50和4.40美元。这说明分档算术,不是同任务实测;实际分词、思考、返工和工具会改变账单。

用一份三部分采购分析包比较

第一部分给公开规格和价格表,要求逐字段提取并引用来源,检查单位、税费口径和缺项。第二部分给互相冲突的两版维护条款,要求指出适用版本,不能自行拼成新承诺。第三部分给一个小型数据清洗程序,要求修复重复记录且通过回归测试。

每部分单独评分:事实准确、引用支撑、未证实断言、代码测试、人工修改量和总费用。材料与预算一致,涉及音视频时单列原生输入与转写/抽帧流程,不把预处理差异藏进“模型能力”。

为什么不把公开分数拼成冠军

SWE-bench Verified与Pro、终端任务、学术问答和用户偏好测量的是不同对象;版本、工具与计算预算也影响分数。某项高分不能推导“注释更好”或“所有中文用户更喜欢”,也不能证明无需人工的长时间执行。

对已有历史榜单可保留原链接、日期和方法,但缺少条件就写未能复核。发布文章展示的案例与本文实际运行记录分开,本页没有在线运行三模型横评,也没有重现供应商测试。

落地前最后检查

确认确切模型ID、Preview/退役状态、数据目的地、预算和必要工具;用自己的验收包先试运行,再决定是否增加规模。学生、团队和API用户的权益不同,不能笼统承诺三款都能免费使用。选择应由任务合格率与总成本支持,而不是沿用旧文的“终极横评”标签。

参考来源

资料核对日期:2026-10-04。涉及产品与账户条件时,请以当前官方说明为准。