大模型 API 调用费用对比:GPT / Claude / DeepSeek 每百万 token 价格表(2026)

先说结论:在聚合平台按每百万 token 折算,DeepSeek 是绝对的价格洼地(deepseek-v4-flash 输入低至 $0.14),Claude 旗舰与 GPT 旗舰落在同一档(约 $0.5–0.6 输入),顶配的 claude-fable-5 则要 $3.5。下面用一张速查表 + 三张分表,把主要厂商的调用费用一次说清。

引言

产品经理给了三天期限,你却在第一关就卡住了:同一句话,GPT 和 Claude 的账单能差好几倍,DeepSeek 便宜得可疑,还有个叫 Kimi 的专吃长文档。每家厂商官网一份定价页,汇率、计费单位、上下文价格各不相同。比价比到怀疑人生。

这篇文章把这个问题拆开:先讲清 API 计费的三个核心概念,再按厂商给出每百万 token 的输入 / 输出价格表。最后按"聊天 / 代码 / 长文档 / 批量"四个真实场景给选型建议。所有价格数字来自 Yomi API 模型广场线上数据,一个 Key 即可实测对照。

为什么不去厂商官网直接比?三个原因:各家计价单位不统一,有的按 token、有的按字符,还有的拆成多档套餐;汇率与税费口径混乱,美元标价换算下来经常对不上;更重要的是,同一个模型放在聚合平台上,因为线路不同价格可以差出好几倍。这篇文章统一用每百万 token 的美元价口径,让你在同一个坐标系里横向比较。

档位代表模型输入 $/1M输出 $/1M一句话定位
性价比 deepseek-v4-flash 0.14 0.28 极速轻量,高频调用的首选
均衡 claude-sonnet-5 0.24 1.20 编程与日常对话的主力档
旗舰 claude-opus-5 0.60 3.00 复杂推理、长程 Agent 任务
顶配 claude-fable-5 3.50 17.50 巅峰性能,成本敏感度最低时用

关键要点

  • 费用按 token 计量,输入与输出分开计价,输出通常贵数倍(DeepSeek 是 2 倍,多数旗舰是 5–6 倍)。
  • 缓存命中按输入价的 1–2 折计费,反复读取同一批上下文时成本能明显压下来。
  • 同一模型在不同线路价格不同,本文表格按平台当前可用的最便宜线路折算。
  • 支持微信 / 支付宝人民币充值,按 token 精确计量,消费明细在控制台笔笔可查。

先看懂三件事:token 计量、输入输出分价、缓存与批量

比价之前,得先把账单的算法搞明白。大模型 API 的计费不是"一条消息多少钱",而是按 token 数乘以单价,输入和输出各算各的。

第一,token 怎么数。 一个 token 大约是 0.7–1 个汉字,或半个多英文单词。100 万 token 的输入,差不多是 70–90 万字的原文。绝大多数产品一个月根本用不到这个量级。所以"每百万 token 价格"看着吓人,实际换算到业务里,通常一次调用只要几分钱到几毛钱。

第二,输入和输出分开计价。你在表单里填的提示词、历史对话、资料全文,全部按输入价计费;模型生成的回答按输出价计费。输出价通常是输入价的数倍——DeepSeek 的倍数是 2,Claude 与 Kimi 是 5,GPT 旗舰是 6。一次"长提示词、短回答"的调用,成本几乎全落在输入;反过来,推理类任务回答长,输出单价才是账单上真正的那根杠杆。

第三,缓存价与批量价。多数模型支持上下文缓存:命中缓存的输入按输入价的 1–2 折计费(Claude、GPT 系约 1 折,GLM 系约 1.9 折,DeepSeek 的 deepseek-v4-pro 更是低至 0.8%)。需要先写缓存时,按输入价的 1.25 倍计费。如果你的场景是"同一批文档反复问",缓存能让单位成本降一个量级。

记住这条主线:高频低成本选 DeepSeek,均衡体验选 Sonnet 档,重活选 Opus / GPT 旗舰,长文档选 Kimi——后面的价格表就是给这条主线补细节。

按厂商看:Anthropic / OpenAI / DeepSeek / 智谱 / Kimi 每百万 token 价格

下面按厂商列出当前在售主力模型的输入 / 输出价格。数字来自线上定价接口快照,模型名以 模型广场实际列表 为准。

Anthropic(Claude 系列)

模型输入 $/1M输出 $/1M定位
claude-sonnet-4-60.361.80均衡高效,日常主力
claude-sonnet-50.241.20均衡编程助手,性价比高
claude-opus-4-60.603.00高端编程推理
claude-opus-4-70.603.00进阶专业旗舰
claude-opus-4-80.603.00顶级推理旗舰,长程 Agent
claude-opus-50.603.00深度推理王者
claude-fable-53.5017.50顶配旗舰,巅峰性能

Claude 系列是同厂商内价差最大的一组:Sonnet 档承担日常任务,Opus 档四款全部同价($0.6 / $3),适合按任务难度直接选。只有对性能上限有硬要求的场景才需要上 claude-fable-5,它的输出单价是 Opus 档的近 6 倍。

给预算有限团队一个参考:claude-sonnet-5 的输入价($0.24)甚至低于 Opus 档的一半,编程与日常对话能力却足够覆盖大部分业务。把 Opus 档留给真正需要"认真推理"的那 10% 请求,是 Claude 系最省钱的用法。

OpenAI(GPT 系列)

模型输入 $/1M输出 $/1M定位
gpt-5.40.251.50上代旗舰,成熟稳定
gpt-5.50.503.00深度思考主力
gpt-5.6-terra0.201.20编程专精,轻量高频
gpt-5.6-sol0.503.00顶配旗舰,1M 超长上下文

GPT 家族里 gpt-5.6-terra 值得单独记住:编程专精、价格贴着 DeepSeek 走,代码补全与轻量 Agent 场景非常能打。

如果业务对生态兼容性敏感——比如已有大量基于 OpenAI 接口的代码——GPT 家族是零改动的选择。gpt-5.4 负责稳定存量,gpt-5.6-sol 承接需要 1M 长上下文的增量,新老模型共用一套接入代码。

DeepSeek(性价比标杆)

模型输入 $/1M输出 $/1M定位
deepseek-v4-flash0.140.28极速轻量,高频首选
deepseek-v4-pro0.430.87深度推理,极致性价比

DeepSeek 两款模型的输出倍数只有 2,是主力厂商里最低的。推理类任务输出动辄几千 token,选它能把"回答成本"压到同档竞品的三分之一左右。

DeepSeek 的缓存价也很低(deepseek-v4-pro 命中缓存约 0.8 折),配合 2 倍的输出倍数,是"文档问答 + 长回答生成"这类场景的最优解。低倍数的另一面是推理深度相对收敛,遇到真正硬核的多步推理,还是要把 Opus 或 GPT 旗舰拿出来。

智谱(GLM 系列)

模型输入 $/1M输出 $/1M定位
glm-5.20.842.64国产主力,稳定可靠
glm-5.20.842.64国产旗舰,全能升级

GLM 两代同价,升级换代不影响预算,适合对国产模型有要求、且希望成本可预期的团队。

Kimi(长文档标杆)

模型输入 $/1M输出 $/1M定位
kimi-k31.809.00超长上下文,长文档标杆

Kimi 的单价在表格里偏高,但它的长上下文能力是核心卖点。百万级上下文场景下,别的模型要靠分片与重发把输入成本滚雪球,它一次读完。折算单次任务的总体成本,长文档场景里它常常反而是便宜的。

全模型价格对比大表(一表看懂)

把上面所有模型放进同一张表,横向对比输入、输出单价与适用场景:

模型输入 $/1M输出 $/1M适用场景
deepseek-v4-flash0.140.28聊天机器人、批量分类、高频小任务
gpt-5.6-terra0.201.20代码补全、轻量 Agent、结构化输出
claude-sonnet-50.241.20日常对话、通用编程、工具调用
gpt-5.40.251.50稳定生产环境、兼容性优先
claude-sonnet-4-60.361.80中长上下文对话、日常主力
deepseek-v4-pro0.430.87深度推理、复杂分析、长输出任务
gpt-5.50.503.00深度思考、复杂问题拆解
gpt-5.6-sol0.503.00顶配推理、1M 长上下文
claude-opus-4-60.603.00高难代码、架构规划
claude-opus-4-70.603.00专业分析、复杂推理
claude-opus-4-80.603.00顶级推理、长程 Agent
claude-opus-50.603.00深度推理王者、硬核任务
glm-5.20.842.64国产方案、稳定业务
glm-5.20.842.64国产旗舰、全能型任务
kimi-k31.809.00百万级长文档、报告分析
claude-fable-53.5017.50巅峰性能、质量优先的顶配场景

数据快照 2026-08-08,价格随官方调整,实时价格以 模型广场 为准。横向能看到三条清晰的价格带:$0.14–0.25 是轻量档,$0.24–0.6 是主力档,$0.84 以上进入长上下文与顶配档。

建议把 16 个模型各算一遍,用真实用量而不是感觉来定主力模型:输入单价乘以预估月输入量,再加上输出单价乘以预估月输出量。一个月几十万 token 的轻量业务,选哪个档位差别不大。月用量到千万 token 级,轻量档与顶配档的成本能差出 20 倍以上。

按场景选型:聊天 / 代码 / 长文档 / 批量

价格表是死的,场景是活的。同样是 100 万 token 的月用量,选错模型成本可能差 10 倍。四个高频场景,每类给出推荐与成本量级:

场景推荐模型成本量级(约)选型逻辑
聊天 / 客服 deepseek-v4-flash、claude-sonnet-5 输入为主,每 1M token 约 $0.14–0.24 对话场景输入远大于输出,选输入单价最低的档位即可
代码助手 gpt-5.6-terra、claude-sonnet-5、claude-opus-4-8 中等用量,每 1M token 约 $0.2–0.6 轻量补全用 terra,日常编程用 Sonnet,重活切 Opus
长文档分析 kimi-k3、gpt-5.6-sol 输入量巨大,单次可能达百万 token 级 长上下文模型一次读完,避免分片重发放大输入成本
批量任务 deepseek-v4-pro、deepseek-v4-flash 输出占比高,每 1M token 约 $0.28–0.87 批量场景吃输出价,DeepSeek 输出倍数最低,成本优势明显

给新项目的一个务实建议:先用便宜档把流程跑通、把数据喂熟,再对瓶颈场景单独升档。聚合平台换模型只改一个 model 字段,成本试错的代价几乎为零。

价格会变:认准模型广场的实时价

回到开头的比价焦虑——厂商定价每季度都在调,收藏这篇文章不如收藏一个能实时看价的入口。Yomi API 模型广场 直接展示 200+ 模型 · 30+ Providers 的当前输入 / 输出单价,价格随官方调整同步更新。

选平台时再多留一个心眼:价格只是表面,数据安全才是底线。2026 年 6 月国家安全部发布的"AI 中转站"风险提示点名了数据裸奔、模型缩水、恶意植入、数据出境四类问题;中央网信办也在开展"清朗·整治 AI 应用乱象"专项行动,市场上确实出现过站长因不合规服务被刑拘的案例。选择有消费明细、数据不存储、走 TLS 1.3 加密的平台,比单纯看便宜更重要。正规平台按 token 透明计费,余额与消费笔笔可查。

把价格表存下来反复对照不是目的,让模型在预算内跑起来才是。先小额充值跑一周真实请求,看延迟与稳定性再放量——这是比任何选型公式都靠谱的验证方式。Yomi 支持微信 / 支付宝人民币充值,控制台里的消费明细笔笔可查,实测成本可控。

去模型广场看实时价格 →