DeepSeek API 2026涨价指南:8月17日峰谷价格、成本计算与模型选型

价格提醒: DeepSeek官方公布的新一轮API价格将于北京时间 2026年8月17日00:00 生效。每日 09:00—12:00、14:00—18:00 为高峰时段,其余时间为空闲时段;高峰价格为空闲价格的2倍。

对于经常调用DeepSeek API的开发者和企业来说,这次调整不只是简单涨价,还引入了更明确的峰谷计费。批量任务安排在空闲时段、提高上下文缓存命中率、合理选择Flash或Pro,都会直接影响最终账单。

一、新价格是多少?

以下价格单位均为 人民币元/100万Token。输入Token需要继续区分“缓存命中”和“缓存未命中”,不能只按一个统一输入价估算。

模型 时段 缓存命中输入 缓存未命中输入 输出
deepseek-v4-flash 空闲 ¥0.05 ¥1.50 ¥4.50
deepseek-v4-flash 高峰 ¥0.10 ¥3.00 ¥9.00
deepseek-v4-pro 空闲 ¥0.15 ¥4.50 ¥13.50
deepseek-v4-pro 高峰 ¥0.30 ¥9.00 ¥27.00

价格关系很清楚:

  • 高峰价统一为空闲价的 2倍
  • Pro三项费率统一为Flash的 3倍
  • 输出Token明显贵于输入Token,长篇生成尤其需要控制输出长度;
  • 缓存命中仍然非常便宜,但不能把“理论上可缓存”当成实际账单已经命中。

二、与旧价格相比涨了多少?

调整前,Flash的缓存命中输入、未命中输入和输出价格分别为¥0.02、¥1.00和¥2.00;Pro分别为¥0.025、¥3.00和¥6.00。

新价格生效后:

  • Flash空闲时段三项价格分别上涨 150%、50%、125%
  • Pro空闲时段分别上涨 500%、50%、125%
  • 高峰时段涨幅更明显,Pro缓存命中输入最高达到旧价的 12倍
  • 即使避开高峰,实际成本也会高于旧价格。

因此,原来按照旧价设置的预算、产品套餐和调用限额,都需要在8月17日前重新核算。

三、典型任务要花多少钱?

API账单可以使用下面的公式估算:

成本 = 缓存命中输入Token ÷ 1,000,000 × 命中单价
     + 缓存未命中输入Token ÷ 1,000,000 × 未命中单价
     + 输出Token ÷ 1,000,000 × 输出单价

几个常见场景如下:

用量场景 Flash空闲/高峰 Pro空闲/高峰
100万未缓存输入 + 100万输出 ¥6.00 / ¥12.00 ¥18.00 / ¥36.00
100万未缓存输入 + 10万输出 ¥1.95 / ¥3.90 ¥5.85 / ¥11.70
10万未缓存输入 + 1万输出 ¥0.195 / ¥0.39 ¥0.585 / ¥1.17
100万缓存命中输入 + 10万输出 ¥0.50 / ¥1.00 ¥1.50 / ¥3.00

从表中可以看到,批量摘要、代码仓库分析、长文档问答等任务,如果输出较长,成本主要由输出Token决定。仅优化输入缓存,还不足以解决长输出带来的费用增长。

四、缓存为什么仍然重要?

上下文缓存适合复用稳定前缀,例如系统提示词、工具定义、固定知识库前缀和重复代码上下文。

新价格下,无论Flash还是Pro,空闲和高峰时段的缓存命中输入价都比未命中价低约 96.67%。这意味着:

  1. 固定提示词和工具Schema应尽量保持稳定;
  2. 重复文档不要每轮重新拼接成完全不同的前缀;
  3. 批量任务可按相同上下文分组,提高复用机会;
  4. 成本报表要读取真实usage数据,不能预设100%命中;
  5. 如果上游无法可靠区分缓存命中,预算应按未命中价保守估算。

五、Flash和Pro怎么选?

两档模型当前公开能力包括100万Token上下文、最大384K Token输出、思考模式、JSON Output、基础Tool Calls,以及OpenAI和Anthropic兼容接口。

Flash更适合这些任务

  • 日常对话、摘要、分类和结构化提取;
  • 高频、批量或延迟敏感任务;
  • 需要严格控制单位成本的产品;
  • 先用低成本模型完成初筛,再把少量难题升级处理。

Flash官方账号级并发上限为 2500,更适合大规模请求。

Pro更适合这些任务

  • 对推理质量要求更高的复杂任务;
  • 少量高价值、允许显式提高预算的请求;
  • 已通过真实业务评测,证明质量收益足以覆盖3倍价格的场景。

Pro账号级并发上限为 500。由于其输入与输出价格均为Flash的3倍,不建议在没有质量评测的情况下静默升级全部请求。

六、协议能力有哪些注意事项?

1. 请求并发与工具并行不是一回事

DeepSeek支持多个独立API请求并发,Flash和Pro的账号级并发分别为2500和500。但“单次模型响应稳定返回多个可并行执行的工具调用”目前不宜作为已确认能力。

官方Tool Calls文档展示了基础工具调用流程,但Chat Completions参数表没有公开 parallel_tool_calls 参数,也没有稳定并行工具调用的承诺。因此,Agent程序可以兼容遍历 tool_calls 数组,但业务流程不应依赖一轮必须返回多个并行调用。

2. Anthropic兼容不等于完整Claude能力

DeepSeek提供Anthropic格式接口,但图片、文档、搜索结果、服务端工具、MCP和代码执行等内容块并非全部支持。部分模型名还会自动映射到Flash或Pro。接入时应记录真实路由模型,避免调用方写错模型名后仍返回结果,却无法发现实际使用了哪一档。

3. 超长上下文不等于推荐用量

100万Token上下文和384K Token最大输出属于能力上限。真实应用还要考虑延迟、并发占用、失败率和输出有效性,不宜为了“用满窗口”而发送无关内容。

七、如何降低涨价后的API成本?

可以从以下几方面入手:

  1. 批量任务错峰执行:非实时任务优先安排在空闲时段;
  2. 默认使用Flash:只有质量评测明确证明收益时再升级Pro;
  3. 控制输出长度:通过明确格式、字段数量和停止条件减少无效生成;
  4. 提高缓存复用:稳定系统提示词、工具定义和长上下文前缀;
  5. 分层处理任务:Flash负责分类和初筛,Pro只处理复杂少数样本;
  6. 建立费用上限:按用户、任务、模型和时段设置预算与告警;
  7. 以实际账单校准:理论单价、usage统计和控制台扣费要定期对账。

八、开发者现在应该做什么?

在新价格生效前,建议完成三项检查:

  • 更新价格配置,明确人民币、100万Token、北京时间和生效日期;
  • 重新计算典型任务成本,尤其是长输出和高峰请求;
  • 检查模型路由、缓存命中统计、并发限制与429重试策略。

如果产品向用户展示价格,还应把缓存命中价与未命中价分开说明,避免用最低价格制造误解。对于企业应用,模型质量、稳定性和完成任务的总成本,比单看每百万Token价格更重要。

官方资料

本文依据2026年8月13日可见的DeepSeek官方中文文档整理。价格、模型版本与协议能力可能继续调整,实际费用请以上游实时价格页和账户账单为准。

关联文章推荐

关联问答推荐

文章评论

登录后才能发布评论哦
立即登录/注册
还没有评论,快来抢沙发吧~
消息提醒
Hello, world! This is a toast message.