Google Gemini 3.6 Flash 发布:更快、更省、更适合 Agent 工作流

Google Gemini 3.6 Flash 到底更新了什么 🚀

Google 这次一口气放出三款 Gemini 新模型,其中最值得关注的是 Gemini 3.6 Flash。它不是单纯“更强一点”,而是把“更快、更省、更实用”同时做到了。

如果只看一句话总结:

  • 输出更便宜
  • 生成更快
  • token 更省
  • 实际任务表现更稳

对经常用 AI 写代码、做 Agent 编排、跑工具链的人来说,这类升级比单纯刷榜更有价值。

价格先降下来:3.6 Flash 更适合高频调用 💡

这次最直观的变化,就是定价下调。

  • 3.5 Flash 的输出价格:每百万 token 9 美元
  • 3.6 Flash 的输出价格:每百万 token 7.5 美元
  • 输入价格保持不变:每百万 token 1.5 美元

别小看这 1.5 美元的差距。对于小规模测试可能不明显,但一旦进入真实业务,比如:

  • 批量问答
  • 多轮 Agent 对话
  • 自动化内容处理
  • 编码与调试任务

成本差异会被快速放大。尤其是多步骤工作流里,模型每一步都要调用一次,累计下来就很容易拉开预算。

不只是便宜,还更省 token

很多人只看单次价格,其实真正影响账单的,还有 token 消耗。

Google 公布的数据里,3.6 Flash 在多个评测中都更省 token:

  • Artificial Analysis Index 平均少用 17% 输出 token
  • 在部分 DeepSWE 编码测试中,token 消耗最多降低 65%
  • 实测账单从 1041 美元降到 727 美元,节省接近三成

这意味着什么?

简单说就是:

  • 同样的任务,花得更少
  • 同样的预算,能跑更多次
  • 对长文本、长链路推理更友好

对于要做稳定生产的团队,这种“少说废话”的模型往往更受欢迎。

速度提升明显,适合多步 Agent 工作流

3.6 Flash 另一个很实用的变化,是速度。

  • 3.6 Flash 生成速度:304 tokens/s
  • 3.5 Flash 生成速度:165 tokens/s

接近翻倍。

这对普通聊天未必有特别强的体感,但对 Agent 场景很关键。因为 Agent 不只是“答一句话”,而是常常要经历:

  1. 读取任务
  2. 规划步骤
  3. 调用工具
  4. 处理中间结果
  5. 再输出最终答案

每一步都快一点,最后整体完成时间就会缩短很多。对于需要实时反馈的产品,体验差异会非常明显。

智能水平没有掉队,关键任务表现更稳

便宜和快,不代表能力下降。3.6 Flash 在不少指标上依然很能打。

核心评测结果

  • Artificial Analysis Intelligence Index:50,和 3.5 Flash 持平
  • GDPval-AA:1421 分,高于 3.5 Flash 的 1349
  • OSWorld-Verified:从 78.4% 提升到 83%

这说明它不是“降配版”,而是更偏向效率优化。

尤其是 OSWorld-Verified 这类 Computer Use 能力提升,对自动化操作、桌面代理、网页执行都很重要。模型能更稳定地理解界面、执行步骤,实际可用性会更高。

知识更新到 2026 年 3 月,更贴近最新信息

另一个很容易被忽略但很重要的点,是知识截止日期。

  • 3.5 Flash:2025 年 1 月
  • 3.6 Flash:2026 年 3 月

这意味着模型对过去一年多的变化会更熟悉,回答最新技术、产品和行业动态时,信息滞后的问题会少一些。

当然,模型知识更新不等于绝对准确,但在很多需要“尽量新”的场景里,这个提升很实用。

和其他模型比,3.6 Flash 的定位很清楚

这次发布里,Google 没有把 3.6 Flash 做成“榜一冲刺型”模型,而是明确把它放在效率与实用优先的位置。

和其他竞品对比时,它的优势主要体现在:

  • OSWorld 和部分长上下文测试表现不错
  • 成本更友好
  • 速度更快
  • 适合 Agent 和工具调用场景

但如果比最顶级的专项能力,还是各有强项:

  • GPT 5.6 Luna 在 DeepSWE 和 Terminal-bench 更强
  • Grok 4.5 在 SWE-Bench Pro 领先
  • Claude Sonnet 5 在 MLE-Bench 和 GDPVal-AA v2 更高

所以更准确的说法不是“谁全面碾压谁”,而是:不同模型在不同任务上各有最佳使用场景

另外两款模型也各有用途

除了 3.6 Flash,Google 还发布了另外两款模型。

3.5 Flash Lite:走极致低价路线

这款模型更偏向高吞吐场景,价格非常低:

  • 输入:0.30 美元 / 百万 token
  • 输出:2.50 美元 / 百万 token

适合:

  • 搜索
  • 文档处理
  • 大批量内容分类
  • 轻量级自动化任务

3.5 Flash Cyber:面向安全场景

这款模型专注网络安全,目前仅对政府和受信任合作伙伴开放,普通用户暂时接触不到。

已经能用在哪些地方

3.6 Flash 现在已经进入多个 Google 生态产品和开发工具:

  • GitHub Copilot
  • Gemini 应用
  • Google AI Studio
  • Google Antigravity

其中 Antigravity 值得多看一眼。它是 Google 推出的 Agent 开发平台,定位偏向独立桌面应用,强调以 Agent 编排为核心。对开发者来说,它的意义在于:更方便把模型能力组织成完整工作流,而不是只做单轮对话。

这次发布最值得关注的信号

如果把这次更新放到更大的背景里看,Google 的思路很清楚:

  • 不一定每次都追求“最强榜首”
  • 先把高频使用场景做得更便宜、更快、更稳
  • 让开发者更愿意把模型接进真实产品

这也是为什么 3.6 Flash 可能比一些旗舰型号更快进入实战。

对很多团队来说,真正重要的不是参数表上的极限分数,而是:

  • 预算是否扛得住
  • 延迟是否够低
  • 工具调用是否稳定
  • 生产环境是否好落地

3.6 Flash 在这些方面都给出了更均衡的答案。

结语:Flash 可能才是最实用的 Gemini 路线

从这次发布来看,Gemini 3.6 Flash 不是“补位产品”,而是一款很明确的主力实用型模型。它把成本、速度和可用性三件事同时往前推了一步。

如果你在找的是:

  • 更适合 Agent 工作流的模型
  • 更省 token 的 API 方案
  • 更快的推理响应
  • 更适合批量任务的 AI 工具

那 3.6 Flash 值得重点关注。

至于下一代 Gemini 4,Google 已经确认开始了更大规模的预训练。也就是说,后续还会有更大的升级空间。

关联文章推荐

关联问答推荐

文章评论

登录后才能发布评论哦
立即登录/注册
还没有评论,快来抢沙发吧~
消息提醒
Hello, world! This is a toast message.