DeepSeek API 怎么调?价格、接入教程与模型选型(2026)
一句话答案:DeepSeek API 用 OpenAI 兼容接口就能调——base_url 填 https://api.yomiapi.com/v1,model 填 deepseek-v4-pro 或 deepseek-v4-flash,注册拿 Key 后几分钟跑通第一次请求。价格、选型、接入代码与成本算例,下文一次讲清。
引言
上个月,做批量内容工具的开发者小林找到我:他的 GPT 账单一个月涨到快两百美元,而团队做的是中文内容摘要,大部分请求用不着顶配模型。"有没有便宜点的方案,代码最好也别大改?"我给他配了一台 DeepSeek。换完之后,同一个管道,账单降了一个量级,摘要质量基本没差。
小林的情况不算特殊。DeepSeek 开源模型在中文场景的表现,配合按 token 分别计价的输入输出收费方式,让它成为 2026 年性价比路线上的热门选择。这篇文章就从两个型号怎么选讲起,把价格、接入、进阶用法和成本估算一次讲完。
为什么是 DeepSeek?一方面,它走的是开源路线,模型迭代快,社区讨论多,踩坑解法随手能搜到;另一方面,中文语料训练扎实,写文案、做摘要、跑翻译这些国内开发者的高频场景,输出质量稳得住。对预算敏感的小团队来说,先拿 DeepSeek 把业务跑起来,等量上去了再按需引入更强的旗舰模型,是更稳妥的启动路径。
关键要点
- DeepSeek API 走 OpenAI 兼容协议,改 base_url 即可接入,代码结构零改动。
- 两个常用型号:
deepseek-v4-pro(推理 / 编程旗舰)与deepseek-v4-flash(轻量高并发),价格差约三倍。- 真实价格(快照 2026-08-08):v4-pro 输入 $0.43 / 1M tokens、输出 $0.87 / 1M tokens;v4-flash 输入 $0.14、输出 $0.28。
- 一个 Key 可切换全部模型,改 model 字段即可做 Claude / GPT / DeepSeek 的 AB 对比。
- 按 token 计量、输入输出分别计价,消费明细在控制台笔笔可查,支持微信 / 支付宝人民币充值。
两个型号怎么选:deepseek-v4-pro 与 deepseek-v4-flash
DeepSeek 系列里,日常用得最多的两个型号是 deepseek-v4-pro 与 deepseek-v4-flash。名字容易让人以为只是"大版本和小版本",实际上它们是定位不同的两条产品线。
deepseek-v4-pro 是推理旗舰。1M 上下文,深度思考能力对标国际旗舰,适合代码生成、架构设计、长文档分析这类复杂任务。响应速度不是它的卖点,遇到需要多步推理的问题,它值得等。
deepseek-v4-flash 是轻量版。同样 1M 上下文,主打响应快、并发高、成本低,适合翻译、摘要、分类、客服问答这类高频实时场景。批量调用时,它的吞吐表现比 pro 更稳。
先看真实价格表(数据快照 2026-08-08,单位:美元 / 1M tokens):
| 型号 | 输入价格 | 输出价格 | 定位 |
|---|---|---|---|
deepseek-v4-pro |
$0.43 | $0.87 | 推理 / 编程旗舰,复杂任务 |
deepseek-v4-flash |
$0.14 | $0.28 | 轻量快速,高并发实时 |
价格随官方调整,实时价格以模型广场实际列表为准。选型建议就一条:默认先上 flash,延迟和成本都友好;代码、深度推理、长文档这类任务再切 pro。两类场景混用,比全程只用顶配模型省得多。
举一个真实的混用例子:一家做电商评论分析的工具,评论分类、情感打分交给 deepseek-v4-flash,一天几万次请求毫无压力;每周一次的竞品调研报告,才切到 deepseek-v4-pro 做长文归纳。两个型号在同一个 Key 下切换,成本曲线几乎全程贴着低档走。
三步接入:OpenAI SDK 跑通第一次调用
OpenAI 的调用方式同样适用于 DeepSeek,已用官方 SDK 的项目,只改 base_url 与 model 两个字段。具体三步:
- 注册并创建 Key。访问 Yomi API 注册,进控制台的 Keys 页面一键生成 Key,支持按项目创建多个,权限与额度相互隔离。
- 复制 base_url。OpenAI 兼容地址为
https://api.yomiapi.com/v1,注意末尾带/v1。 - 写第一段调用代码。完整 Python 示例:
# pip install openai
from openai import OpenAI
client = OpenAI(
api_key="sk-你的Yomi-API-Key", # 控制台创建的 Key
base_url="https://api.yomiapi.com/v1" # OpenAI 兼容地址,带 /v1
)
resp = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "用三句话解释什么是大模型上下文窗口"}],
)
print(resp.choices[0].message.content)
这段代码跑通后,把 model 换成 deepseek-v4-flash 再跑一次,就能直观感受两个型号的速度差异。响应格式与 OpenAI 一致,原有代码结构零改动。不用 SDK 的话,curl 一行也能验证连通性:
curl https://api.yomiapi.com/v1/chat/completions \
-H "Authorization: Bearer sk-你的Yomi-API-Key" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [{"role": "user", "content": "你好"}]
}'
看到返回里的 choices[0].message.content 字段,就说明链路已经通了。
进阶用法:流式输出,以及一个 Key 的 AB 对比
流式输出。长回答用 stream=True,首字更快,用户的等待感更低:
stream = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "写一篇 300 字的产品发布稿"}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="")
同 Key 切换模型做 AB 对比,是本平台最实用的一条用法。Yomi 一个 Key 能调用全部 200+ 模型,切换只改 model 字段:deepseek-v4-pro ↔ claude-sonnet-5 ↔ gpt-5.5。评测同一个任务时,把各模型的输出与账单成本存下来对比,用数据决定主力模型,比拍脑袋靠谱。具体模型以模型广场实际列表为准。
两个小提示。第一,批量请求建议在客户端做好并发控制,并配合重试,遇到瞬时抖动自动重放一次即可。第二,长时间占用长上下文的会话,可以把历史消息精简后重新组织,减少重复计费的输入 token。
更完整的接口细节,可以对照OpenAI API 接入教程——两者协议一致,读一篇就够。
成本估算:按 token 分别计价,100 万 token 多少钱
Yomi 按 token 计量,输入与输出分开计价,输出 token 比输入贵,估算预算时别只算输入。两个型号的差异,用一组真实价格算一遍最直观(快照 2026-08-08):
| 用量 | deepseek-v4-pro | deepseek-v4-flash |
|---|---|---|
| 100 万输入 + 100 万输出 | $0.43 + $0.87 = $1.30 | $0.14 + $0.28 = $0.42 |
| 1 万次摘要(每次约 1 万输入 + 2 千输出) | 约 $604 | 约 $196 |
同样一批任务,flash 的成本只有 pro 的三分之一左右。放到真实场景里,1 万次摘要调用就能省下约 400 美元,这个差距在长周期里会持续放大。微信 / 支付宝人民币充值,每笔消费明细在控制台笔笔可查,不会出现"扣了多少说不清"的情况。
顺便提醒一句:如果遇到价格低得反常的"超低价接口",先警惕起来。2026 年 6 月 8 日国家安全部发布过"AI 中转站"风险提示,点名数据裸奔、模型缩水、恶意植入与数据出境四类风险。正规平台至少有 TLS 1.3 加密传输、数据不存储、智能路由故障自动切换这些底线配置,选渠道时值得逐条核对。
常见问题:上下文、中文场景与工具调用
- 上下文多长?两个型号都支持 1M token 上下文(具体以模型广场实际列表为准)。长文档可以直接整篇传入,不必自己切 chunk。
- 中文场景表现如何?中文语料是 DeepSeek 的优势项,摘要、文案、翻译都是它的强项,这也是它在本地化项目里口碑好的原因。
- 支持工具调用吗?支持。
deepseek-v4-pro带 Tool Calling,可以接函数调用,做 Agent 类应用没问题;deepseek-v4-flash同样支持。 - 怎么充值、怎么看消耗?微信 / 支付宝人民币充值,按 token 计量、输入输出分别计价,每笔消费明细在控制台笔笔可查。
- 遇到 401 / 429 报错怎么办?401 检查 api_key 是否复制完整;429 通常是并发过高触发了限流,适当放慢请求节奏,必要时按项目拆分 Key 隔离流量。
写在最后
回到开头小林的问题。答案不是"要不要用 DeepSeek",而是"什么任务交给哪个型号"。批量与高频任务交给 deepseek-v4-flash,复杂推理与代码交给 deepseek-v4-pro,拿不准的时候就同一个 Key 来回切,跑数据对比。小林的账单降下来之后,把省下的预算拿去开了更高频的监控任务,反而把产品体验做上去了。
现在动手:注册 → 创建 Key → 把上面的代码跑一遍。几分钟,就能看到 DeepSeek 的第一次回复。想看各模型横向比价,参考大模型 API 价格对比,一次看清 200+ 模型的价差。
Yomi API