Google Gemini 3.6 Flash 发布:更快、更省、更适合 Agent 工作流
Google Gemini 3.6 Flash 到底更新了什么 🚀
Google 这次一口气放出三款 Gemini 新模型,其中最值得关注的是 Gemini 3.6 Flash。它不是单纯“更强一点”,而是把“更快、更省、更实用”同时做到了。
如果只看一句话总结:
- 输出更便宜
- 生成更快
- token 更省
- 实际任务表现更稳
对经常用 AI 写代码、做 Agent 编排、跑工具链的人来说,这类升级比单纯刷榜更有价值。
价格先降下来:3.6 Flash 更适合高频调用 💡
这次最直观的变化,就是定价下调。
- 3.5 Flash 的输出价格:每百万 token 9 美元
- 3.6 Flash 的输出价格:每百万 token 7.5 美元
- 输入价格保持不变:每百万 token 1.5 美元
别小看这 1.5 美元的差距。对于小规模测试可能不明显,但一旦进入真实业务,比如:
- 批量问答
- 多轮 Agent 对话
- 自动化内容处理
- 编码与调试任务
成本差异会被快速放大。尤其是多步骤工作流里,模型每一步都要调用一次,累计下来就很容易拉开预算。
不只是便宜,还更省 token
很多人只看单次价格,其实真正影响账单的,还有 token 消耗。
Google 公布的数据里,3.6 Flash 在多个评测中都更省 token:
- Artificial Analysis Index 平均少用 17% 输出 token
- 在部分 DeepSWE 编码测试中,token 消耗最多降低 65%
- 实测账单从 1041 美元降到 727 美元,节省接近三成
这意味着什么?
简单说就是:
- 同样的任务,花得更少
- 同样的预算,能跑更多次
- 对长文本、长链路推理更友好
对于要做稳定生产的团队,这种“少说废话”的模型往往更受欢迎。
速度提升明显,适合多步 Agent 工作流
3.6 Flash 另一个很实用的变化,是速度。
- 3.6 Flash 生成速度:304 tokens/s
- 3.5 Flash 生成速度:165 tokens/s
接近翻倍。
这对普通聊天未必有特别强的体感,但对 Agent 场景很关键。因为 Agent 不只是“答一句话”,而是常常要经历:
- 读取任务
- 规划步骤
- 调用工具
- 处理中间结果
- 再输出最终答案
每一步都快一点,最后整体完成时间就会缩短很多。对于需要实时反馈的产品,体验差异会非常明显。
智能水平没有掉队,关键任务表现更稳
便宜和快,不代表能力下降。3.6 Flash 在不少指标上依然很能打。
核心评测结果
- Artificial Analysis Intelligence Index:50,和 3.5 Flash 持平
- GDPval-AA:1421 分,高于 3.5 Flash 的 1349
- OSWorld-Verified:从 78.4% 提升到 83%
这说明它不是“降配版”,而是更偏向效率优化。
尤其是 OSWorld-Verified 这类 Computer Use 能力提升,对自动化操作、桌面代理、网页执行都很重要。模型能更稳定地理解界面、执行步骤,实际可用性会更高。
知识更新到 2026 年 3 月,更贴近最新信息
另一个很容易被忽略但很重要的点,是知识截止日期。
- 3.5 Flash:2025 年 1 月
- 3.6 Flash:2026 年 3 月
这意味着模型对过去一年多的变化会更熟悉,回答最新技术、产品和行业动态时,信息滞后的问题会少一些。
当然,模型知识更新不等于绝对准确,但在很多需要“尽量新”的场景里,这个提升很实用。
和其他模型比,3.6 Flash 的定位很清楚
这次发布里,Google 没有把 3.6 Flash 做成“榜一冲刺型”模型,而是明确把它放在效率与实用优先的位置。
和其他竞品对比时,它的优势主要体现在:
- OSWorld 和部分长上下文测试表现不错
- 成本更友好
- 速度更快
- 适合 Agent 和工具调用场景
但如果比最顶级的专项能力,还是各有强项:
- GPT 5.6 Luna 在 DeepSWE 和 Terminal-bench 更强
- Grok 4.5 在 SWE-Bench Pro 领先
- Claude Sonnet 5 在 MLE-Bench 和 GDPVal-AA v2 更高
所以更准确的说法不是“谁全面碾压谁”,而是:不同模型在不同任务上各有最佳使用场景。
另外两款模型也各有用途
除了 3.6 Flash,Google 还发布了另外两款模型。
3.5 Flash Lite:走极致低价路线
这款模型更偏向高吞吐场景,价格非常低:
- 输入:0.30 美元 / 百万 token
- 输出:2.50 美元 / 百万 token
适合:
- 搜索
- 文档处理
- 大批量内容分类
- 轻量级自动化任务
3.5 Flash Cyber:面向安全场景
这款模型专注网络安全,目前仅对政府和受信任合作伙伴开放,普通用户暂时接触不到。
已经能用在哪些地方
3.6 Flash 现在已经进入多个 Google 生态产品和开发工具:
- GitHub Copilot
- Gemini 应用
- Google AI Studio
- Google Antigravity
其中 Antigravity 值得多看一眼。它是 Google 推出的 Agent 开发平台,定位偏向独立桌面应用,强调以 Agent 编排为核心。对开发者来说,它的意义在于:更方便把模型能力组织成完整工作流,而不是只做单轮对话。
这次发布最值得关注的信号
如果把这次更新放到更大的背景里看,Google 的思路很清楚:
- 不一定每次都追求“最强榜首”
- 先把高频使用场景做得更便宜、更快、更稳
- 让开发者更愿意把模型接进真实产品
这也是为什么 3.6 Flash 可能比一些旗舰型号更快进入实战。
对很多团队来说,真正重要的不是参数表上的极限分数,而是:
- 预算是否扛得住
- 延迟是否够低
- 工具调用是否稳定
- 生产环境是否好落地
3.6 Flash 在这些方面都给出了更均衡的答案。
结语:Flash 可能才是最实用的 Gemini 路线
从这次发布来看,Gemini 3.6 Flash 不是“补位产品”,而是一款很明确的主力实用型模型。它把成本、速度和可用性三件事同时往前推了一步。
如果你在找的是:
- 更适合 Agent 工作流的模型
- 更省 token 的 API 方案
- 更快的推理响应
- 更适合批量任务的 AI 工具
那 3.6 Flash 值得重点关注。
至于下一代 Gemini 4,Google 已经确认开始了更大规模的预训练。也就是说,后续还会有更大的升级空间。
创建: 2026-07-22
关联文章推荐
- 微软全面转向Copilot:数千员工放弃Claude Code的背后
- Google Gemini模型运算量争议引热议,六大新举措应对用户不满
- GitHub Copilot调整为Token计价模式:用户热议新订阅模式
- OpenAI考虑大幅降价:Token收费或将下调,AI成本战要来了
- GPT Pro 5x 值不值?告别 token 焦虑后的真实体验
- OpenAI突然降价?GPT-5.5价格战或将重塑AI市场
- OpenAI Codex Record & Replay 功能上线:录一遍,后面自动重放执行
- Claude Code Artifacts 为何更好用也更费 Token
- OpenAI与Anthropic集体改收费:AI“无限使用”时代真的结束了
- step-3.7-flash实测:多模态Agent、代码生成和工具调用到底强不强
- Google AI Pro 用量规则变了:Gemini 按算力限额,订阅逻辑全面升级
- 微博CLI服务是什么:让Agent直接调用微博能力的实用指南
- Nano Banana 2 Lite 发布:4秒出图、单张0.034美元,还能直出视频
- Windows ChatGPT电脑操作权限是什么?一次性允许和始终允许区别
- Google Gemini 3.6 Flash 发布:更快、更省、更适合 Agent 工作流
- Gemini报错User location is not supported怎么办?Google AI Pro及API地...
登录后才能发布评论哦
立即登录/注册