大模型 API 调用费用对比:GPT / Claude / DeepSeek 每百万 token 价格表(2026)
先说结论:在聚合平台按每百万 token 折算,DeepSeek 是绝对的价格洼地(deepseek-v4-flash 输入低至 $0.14),Claude 旗舰与 GPT 旗舰落在同一档(约 $0.5–0.6 输入),顶配的 claude-fable-5 则要 $3.5。下面用一张速查表 + 三张分表,把主要厂商的调用费用一次说清。
引言
产品经理给了三天期限,你却在第一关就卡住了:同一句话,GPT 和 Claude 的账单能差好几倍,DeepSeek 便宜得可疑,还有个叫 Kimi 的专吃长文档。每家厂商官网一份定价页,汇率、计费单位、上下文价格各不相同。比价比到怀疑人生。
这篇文章把这个问题拆开:先讲清 API 计费的三个核心概念,再按厂商给出每百万 token 的输入 / 输出价格表。最后按"聊天 / 代码 / 长文档 / 批量"四个真实场景给选型建议。所有价格数字来自 Yomi API 模型广场线上数据,一个 Key 即可实测对照。
为什么不去厂商官网直接比?三个原因:各家计价单位不统一,有的按 token、有的按字符,还有的拆成多档套餐;汇率与税费口径混乱,美元标价换算下来经常对不上;更重要的是,同一个模型放在聚合平台上,因为线路不同价格可以差出好几倍。这篇文章统一用每百万 token 的美元价口径,让你在同一个坐标系里横向比较。
| 档位 | 代表模型 | 输入 $/1M | 输出 $/1M | 一句话定位 |
|---|---|---|---|---|
| 性价比 | deepseek-v4-flash |
0.14 | 0.28 | 极速轻量,高频调用的首选 |
| 均衡 | claude-sonnet-5 |
0.24 | 1.20 | 编程与日常对话的主力档 |
| 旗舰 | claude-opus-5 |
0.60 | 3.00 | 复杂推理、长程 Agent 任务 |
| 顶配 | claude-fable-5 |
3.50 | 17.50 | 巅峰性能,成本敏感度最低时用 |
关键要点
- 费用按 token 计量,输入与输出分开计价,输出通常贵数倍(DeepSeek 是 2 倍,多数旗舰是 5–6 倍)。
- 缓存命中按输入价的 1–2 折计费,反复读取同一批上下文时成本能明显压下来。
- 同一模型在不同线路价格不同,本文表格按平台当前可用的最便宜线路折算。
- 支持微信 / 支付宝人民币充值,按 token 精确计量,消费明细在控制台笔笔可查。
先看懂三件事:token 计量、输入输出分价、缓存与批量
比价之前,得先把账单的算法搞明白。大模型 API 的计费不是"一条消息多少钱",而是按 token 数乘以单价,输入和输出各算各的。
第一,token 怎么数。 一个 token 大约是 0.7–1 个汉字,或半个多英文单词。100 万 token 的输入,差不多是 70–90 万字的原文。绝大多数产品一个月根本用不到这个量级。所以"每百万 token 价格"看着吓人,实际换算到业务里,通常一次调用只要几分钱到几毛钱。
第二,输入和输出分开计价。你在表单里填的提示词、历史对话、资料全文,全部按输入价计费;模型生成的回答按输出价计费。输出价通常是输入价的数倍——DeepSeek 的倍数是 2,Claude 与 Kimi 是 5,GPT 旗舰是 6。一次"长提示词、短回答"的调用,成本几乎全落在输入;反过来,推理类任务回答长,输出单价才是账单上真正的那根杠杆。
第三,缓存价与批量价。多数模型支持上下文缓存:命中缓存的输入按输入价的 1–2 折计费(Claude、GPT 系约 1 折,GLM 系约 1.9 折,DeepSeek 的 deepseek-v4-pro 更是低至 0.8%)。需要先写缓存时,按输入价的 1.25 倍计费。如果你的场景是"同一批文档反复问",缓存能让单位成本降一个量级。
记住这条主线:高频低成本选 DeepSeek,均衡体验选 Sonnet 档,重活选 Opus / GPT 旗舰,长文档选 Kimi——后面的价格表就是给这条主线补细节。
按厂商看:Anthropic / OpenAI / DeepSeek / 智谱 / Kimi 每百万 token 价格
下面按厂商列出当前在售主力模型的输入 / 输出价格。数字来自线上定价接口快照,模型名以 模型广场实际列表 为准。
Anthropic(Claude 系列)
| 模型 | 输入 $/1M | 输出 $/1M | 定位 |
|---|---|---|---|
claude-sonnet-4-6 | 0.36 | 1.80 | 均衡高效,日常主力 |
claude-sonnet-5 | 0.24 | 1.20 | 均衡编程助手,性价比高 |
claude-opus-4-6 | 0.60 | 3.00 | 高端编程推理 |
claude-opus-4-7 | 0.60 | 3.00 | 进阶专业旗舰 |
claude-opus-4-8 | 0.60 | 3.00 | 顶级推理旗舰,长程 Agent |
claude-opus-5 | 0.60 | 3.00 | 深度推理王者 |
claude-fable-5 | 3.50 | 17.50 | 顶配旗舰,巅峰性能 |
Claude 系列是同厂商内价差最大的一组:Sonnet 档承担日常任务,Opus 档四款全部同价($0.6 / $3),适合按任务难度直接选。只有对性能上限有硬要求的场景才需要上 claude-fable-5,它的输出单价是 Opus 档的近 6 倍。
给预算有限团队一个参考:claude-sonnet-5 的输入价($0.24)甚至低于 Opus 档的一半,编程与日常对话能力却足够覆盖大部分业务。把 Opus 档留给真正需要"认真推理"的那 10% 请求,是 Claude 系最省钱的用法。
OpenAI(GPT 系列)
| 模型 | 输入 $/1M | 输出 $/1M | 定位 |
|---|---|---|---|
gpt-5.4 | 0.25 | 1.50 | 上代旗舰,成熟稳定 |
gpt-5.5 | 0.50 | 3.00 | 深度思考主力 |
gpt-5.6-terra | 0.20 | 1.20 | 编程专精,轻量高频 |
gpt-5.6-sol | 0.50 | 3.00 | 顶配旗舰,1M 超长上下文 |
GPT 家族里 gpt-5.6-terra 值得单独记住:编程专精、价格贴着 DeepSeek 走,代码补全与轻量 Agent 场景非常能打。
如果业务对生态兼容性敏感——比如已有大量基于 OpenAI 接口的代码——GPT 家族是零改动的选择。gpt-5.4 负责稳定存量,gpt-5.6-sol 承接需要 1M 长上下文的增量,新老模型共用一套接入代码。
DeepSeek(性价比标杆)
| 模型 | 输入 $/1M | 输出 $/1M | 定位 |
|---|---|---|---|
deepseek-v4-flash | 0.14 | 0.28 | 极速轻量,高频首选 |
deepseek-v4-pro | 0.43 | 0.87 | 深度推理,极致性价比 |
DeepSeek 两款模型的输出倍数只有 2,是主力厂商里最低的。推理类任务输出动辄几千 token,选它能把"回答成本"压到同档竞品的三分之一左右。
DeepSeek 的缓存价也很低(deepseek-v4-pro 命中缓存约 0.8 折),配合 2 倍的输出倍数,是"文档问答 + 长回答生成"这类场景的最优解。低倍数的另一面是推理深度相对收敛,遇到真正硬核的多步推理,还是要把 Opus 或 GPT 旗舰拿出来。
智谱(GLM 系列)
GLM 两代同价,升级换代不影响预算,适合对国产模型有要求、且希望成本可预期的团队。
Kimi(长文档标杆)
| 模型 | 输入 $/1M | 输出 $/1M | 定位 |
|---|---|---|---|
kimi-k3 | 1.80 | 9.00 | 超长上下文,长文档标杆 |
Kimi 的单价在表格里偏高,但它的长上下文能力是核心卖点。百万级上下文场景下,别的模型要靠分片与重发把输入成本滚雪球,它一次读完。折算单次任务的总体成本,长文档场景里它常常反而是便宜的。
全模型价格对比大表(一表看懂)
把上面所有模型放进同一张表,横向对比输入、输出单价与适用场景:
| 模型 | 输入 $/1M | 输出 $/1M | 适用场景 |
|---|---|---|---|
deepseek-v4-flash | 0.14 | 0.28 | 聊天机器人、批量分类、高频小任务 |
gpt-5.6-terra | 0.20 | 1.20 | 代码补全、轻量 Agent、结构化输出 |
claude-sonnet-5 | 0.24 | 1.20 | 日常对话、通用编程、工具调用 |
gpt-5.4 | 0.25 | 1.50 | 稳定生产环境、兼容性优先 |
claude-sonnet-4-6 | 0.36 | 1.80 | 中长上下文对话、日常主力 |
deepseek-v4-pro | 0.43 | 0.87 | 深度推理、复杂分析、长输出任务 |
gpt-5.5 | 0.50 | 3.00 | 深度思考、复杂问题拆解 |
gpt-5.6-sol | 0.50 | 3.00 | 顶配推理、1M 长上下文 |
claude-opus-4-6 | 0.60 | 3.00 | 高难代码、架构规划 |
claude-opus-4-7 | 0.60 | 3.00 | 专业分析、复杂推理 |
claude-opus-4-8 | 0.60 | 3.00 | 顶级推理、长程 Agent |
claude-opus-5 | 0.60 | 3.00 | 深度推理王者、硬核任务 |
glm-5.2 | 0.84 | 2.64 | 国产方案、稳定业务 |
glm-5.2 | 0.84 | 2.64 | 国产旗舰、全能型任务 |
kimi-k3 | 1.80 | 9.00 | 百万级长文档、报告分析 |
claude-fable-5 | 3.50 | 17.50 | 巅峰性能、质量优先的顶配场景 |
数据快照 2026-08-08,价格随官方调整,实时价格以 模型广场 为准。横向能看到三条清晰的价格带:$0.14–0.25 是轻量档,$0.24–0.6 是主力档,$0.84 以上进入长上下文与顶配档。
建议把 16 个模型各算一遍,用真实用量而不是感觉来定主力模型:输入单价乘以预估月输入量,再加上输出单价乘以预估月输出量。一个月几十万 token 的轻量业务,选哪个档位差别不大。月用量到千万 token 级,轻量档与顶配档的成本能差出 20 倍以上。
按场景选型:聊天 / 代码 / 长文档 / 批量
价格表是死的,场景是活的。同样是 100 万 token 的月用量,选错模型成本可能差 10 倍。四个高频场景,每类给出推荐与成本量级:
| 场景 | 推荐模型 | 成本量级(约) | 选型逻辑 |
|---|---|---|---|
| 聊天 / 客服 | deepseek-v4-flash、claude-sonnet-5 |
输入为主,每 1M token 约 $0.14–0.24 | 对话场景输入远大于输出,选输入单价最低的档位即可 |
| 代码助手 | gpt-5.6-terra、claude-sonnet-5、claude-opus-4-8 |
中等用量,每 1M token 约 $0.2–0.6 | 轻量补全用 terra,日常编程用 Sonnet,重活切 Opus |
| 长文档分析 | kimi-k3、gpt-5.6-sol |
输入量巨大,单次可能达百万 token 级 | 长上下文模型一次读完,避免分片重发放大输入成本 |
| 批量任务 | deepseek-v4-pro、deepseek-v4-flash |
输出占比高,每 1M token 约 $0.28–0.87 | 批量场景吃输出价,DeepSeek 输出倍数最低,成本优势明显 |
给新项目的一个务实建议:先用便宜档把流程跑通、把数据喂熟,再对瓶颈场景单独升档。聚合平台换模型只改一个
model字段,成本试错的代价几乎为零。
价格会变:认准模型广场的实时价
回到开头的比价焦虑——厂商定价每季度都在调,收藏这篇文章不如收藏一个能实时看价的入口。Yomi API 模型广场 直接展示 200+ 模型 · 30+ Providers 的当前输入 / 输出单价,价格随官方调整同步更新。
选平台时再多留一个心眼:价格只是表面,数据安全才是底线。2026 年 6 月国家安全部发布的"AI 中转站"风险提示点名了数据裸奔、模型缩水、恶意植入、数据出境四类问题;中央网信办也在开展"清朗·整治 AI 应用乱象"专项行动,市场上确实出现过站长因不合规服务被刑拘的案例。选择有消费明细、数据不存储、走 TLS 1.3 加密的平台,比单纯看便宜更重要。正规平台按 token 透明计费,余额与消费笔笔可查。
把价格表存下来反复对照不是目的,让模型在预算内跑起来才是。先小额充值跑一周真实请求,看延迟与稳定性再放量——这是比任何选型公式都靠谱的验证方式。Yomi 支持微信 / 支付宝人民币充值,控制台里的消费明细笔笔可查,实测成本可控。
Yomi API