DeepSeek API 2026涨价指南:8月17日峰谷价格、成本计算与模型选型
价格提醒: DeepSeek官方公布的新一轮API价格将于北京时间 2026年8月17日00:00 生效。每日 09:00—12:00、14:00—18:00 为高峰时段,其余时间为空闲时段;高峰价格为空闲价格的2倍。
对于经常调用DeepSeek API的开发者和企业来说,这次调整不只是简单涨价,还引入了更明确的峰谷计费。批量任务安排在空闲时段、提高上下文缓存命中率、合理选择Flash或Pro,都会直接影响最终账单。
一、新价格是多少?
以下价格单位均为 人民币元/100万Token。输入Token需要继续区分“缓存命中”和“缓存未命中”,不能只按一个统一输入价估算。
| 模型 | 时段 | 缓存命中输入 | 缓存未命中输入 | 输出 |
|---|---|---|---|---|
deepseek-v4-flash |
空闲 | ¥0.05 | ¥1.50 | ¥4.50 |
deepseek-v4-flash |
高峰 | ¥0.10 | ¥3.00 | ¥9.00 |
deepseek-v4-pro |
空闲 | ¥0.15 | ¥4.50 | ¥13.50 |
deepseek-v4-pro |
高峰 | ¥0.30 | ¥9.00 | ¥27.00 |
价格关系很清楚:
- 高峰价统一为空闲价的 2倍;
- Pro三项费率统一为Flash的 3倍;
- 输出Token明显贵于输入Token,长篇生成尤其需要控制输出长度;
- 缓存命中仍然非常便宜,但不能把“理论上可缓存”当成实际账单已经命中。
二、与旧价格相比涨了多少?
调整前,Flash的缓存命中输入、未命中输入和输出价格分别为¥0.02、¥1.00和¥2.00;Pro分别为¥0.025、¥3.00和¥6.00。
新价格生效后:
- Flash空闲时段三项价格分别上涨 150%、50%、125%;
- Pro空闲时段分别上涨 500%、50%、125%;
- 高峰时段涨幅更明显,Pro缓存命中输入最高达到旧价的 12倍;
- 即使避开高峰,实际成本也会高于旧价格。
因此,原来按照旧价设置的预算、产品套餐和调用限额,都需要在8月17日前重新核算。
三、典型任务要花多少钱?
API账单可以使用下面的公式估算:
成本 = 缓存命中输入Token ÷ 1,000,000 × 命中单价
+ 缓存未命中输入Token ÷ 1,000,000 × 未命中单价
+ 输出Token ÷ 1,000,000 × 输出单价
几个常见场景如下:
| 用量场景 | Flash空闲/高峰 | Pro空闲/高峰 |
|---|---|---|
| 100万未缓存输入 + 100万输出 | ¥6.00 / ¥12.00 | ¥18.00 / ¥36.00 |
| 100万未缓存输入 + 10万输出 | ¥1.95 / ¥3.90 | ¥5.85 / ¥11.70 |
| 10万未缓存输入 + 1万输出 | ¥0.195 / ¥0.39 | ¥0.585 / ¥1.17 |
| 100万缓存命中输入 + 10万输出 | ¥0.50 / ¥1.00 | ¥1.50 / ¥3.00 |
从表中可以看到,批量摘要、代码仓库分析、长文档问答等任务,如果输出较长,成本主要由输出Token决定。仅优化输入缓存,还不足以解决长输出带来的费用增长。
四、缓存为什么仍然重要?
上下文缓存适合复用稳定前缀,例如系统提示词、工具定义、固定知识库前缀和重复代码上下文。
新价格下,无论Flash还是Pro,空闲和高峰时段的缓存命中输入价都比未命中价低约 96.67%。这意味着:
- 固定提示词和工具Schema应尽量保持稳定;
- 重复文档不要每轮重新拼接成完全不同的前缀;
- 批量任务可按相同上下文分组,提高复用机会;
- 成本报表要读取真实usage数据,不能预设100%命中;
- 如果上游无法可靠区分缓存命中,预算应按未命中价保守估算。
五、Flash和Pro怎么选?
两档模型当前公开能力包括100万Token上下文、最大384K Token输出、思考模式、JSON Output、基础Tool Calls,以及OpenAI和Anthropic兼容接口。
Flash更适合这些任务
- 日常对话、摘要、分类和结构化提取;
- 高频、批量或延迟敏感任务;
- 需要严格控制单位成本的产品;
- 先用低成本模型完成初筛,再把少量难题升级处理。
Flash官方账号级并发上限为 2500,更适合大规模请求。
Pro更适合这些任务
- 对推理质量要求更高的复杂任务;
- 少量高价值、允许显式提高预算的请求;
- 已通过真实业务评测,证明质量收益足以覆盖3倍价格的场景。
Pro账号级并发上限为 500。由于其输入与输出价格均为Flash的3倍,不建议在没有质量评测的情况下静默升级全部请求。
六、协议能力有哪些注意事项?
1. 请求并发与工具并行不是一回事
DeepSeek支持多个独立API请求并发,Flash和Pro的账号级并发分别为2500和500。但“单次模型响应稳定返回多个可并行执行的工具调用”目前不宜作为已确认能力。
官方Tool Calls文档展示了基础工具调用流程,但Chat Completions参数表没有公开 parallel_tool_calls 参数,也没有稳定并行工具调用的承诺。因此,Agent程序可以兼容遍历 tool_calls 数组,但业务流程不应依赖一轮必须返回多个并行调用。
2. Anthropic兼容不等于完整Claude能力
DeepSeek提供Anthropic格式接口,但图片、文档、搜索结果、服务端工具、MCP和代码执行等内容块并非全部支持。部分模型名还会自动映射到Flash或Pro。接入时应记录真实路由模型,避免调用方写错模型名后仍返回结果,却无法发现实际使用了哪一档。
3. 超长上下文不等于推荐用量
100万Token上下文和384K Token最大输出属于能力上限。真实应用还要考虑延迟、并发占用、失败率和输出有效性,不宜为了“用满窗口”而发送无关内容。
七、如何降低涨价后的API成本?
可以从以下几方面入手:
- 批量任务错峰执行:非实时任务优先安排在空闲时段;
- 默认使用Flash:只有质量评测明确证明收益时再升级Pro;
- 控制输出长度:通过明确格式、字段数量和停止条件减少无效生成;
- 提高缓存复用:稳定系统提示词、工具定义和长上下文前缀;
- 分层处理任务:Flash负责分类和初筛,Pro只处理复杂少数样本;
- 建立费用上限:按用户、任务、模型和时段设置预算与告警;
- 以实际账单校准:理论单价、usage统计和控制台扣费要定期对账。
八、开发者现在应该做什么?
在新价格生效前,建议完成三项检查:
- 更新价格配置,明确人民币、100万Token、北京时间和生效日期;
- 重新计算典型任务成本,尤其是长输出和高峰请求;
- 检查模型路由、缓存命中统计、并发限制与429重试策略。
如果产品向用户展示价格,还应把缓存命中价与未命中价分开说明,避免用最低价格制造误解。对于企业应用,模型质量、稳定性和完成任务的总成本,比单看每百万Token价格更重要。
官方资料
- DeepSeek模型与价格
- DeepSeek限速与隔离
- DeepSeek Tool Calls
- DeepSeek Chat Completions API
- DeepSeek Responses API
- DeepSeek Anthropic API
本文依据2026年8月13日可见的DeepSeek官方中文文档整理。价格、模型版本与协议能力可能继续调整,实际费用请以上游实时价格页和账户账单为准。
创建: 2026-08-13
关联文章推荐
- NVIDIA NIM API Build流量限制全解析:免费API试用额度与速率限制详解
- Google Gemini模型运算量争议引热议,六大新举措应对用户不满
- DeepSeek V4接入MinerU:扫描PDF也能高效问答
- DeepSeek V4更新DSpark:推理速度提升80%,推测性解码全面开源
- Anthropic Fable 5 模型或将解禁:最快本周恢复访问
- Grok 4.5发布:更快更便宜的旗舰AI,性能直追Opus 4.8
- GPT-5.6全面上线:ChatGPT Work合体Codex,生产力工具再升级
- Meta Muse Spark 1.1发布:百万token上下文与智能体能力全面升级
登录后才能发布评论哦
立即登录/注册