返回行业动态
模型与产品

Google连发三款Gemini轻量模型:Token消耗最多降65%,旗舰Pro仍延期

美国东部时间7月21日,Google DeepMind正式发布三款全新Gemini轻量模型:Gemini 3.6 Flash(主力效率型)、Gemini 3.5 Flash-Lite(极速轻量型)和Gemini 3.5 Flash Cyber(安全专用型)。主力模型3.6 Flash在编码与多模态任务中,处理相同工作消耗的输出Token比前代减少17%至65%,推理速度翻倍,定价为输入$1.50/输出$7.50每百万Token。然而,曾在5月Google I/O大会承诺6月发布的旗舰模型Gemini 3.5 Pro仍然未见踪影,Google仅表示正在与合作伙伴测试中。Axios同日报道称,DeepMind内部员工士气低落是导致Pro模型数度推迟的重要原因之一。

来源:Google AI Blog × 36氪原标题:Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber查看原文
Google Gemini Flash系列新模型发布概念图:轻量高效AI模型的迭代升级

图片来源:北京拓实科技原创

发生了什么

7月21日,Google DeepMind发布了三款Gemini Flash系列新模型,定位清晰、分层明确:Gemini 3.6 Flash面向编程、知识工作与多模态任务,是主力升级款;Gemini 3.5 Flash-Lite主打高吞吐低延迟,每秒可生成350个输出Token,适配文档处理等高流量场景;Gemini 3.5 Flash Cyber则专注于安全领域,通过CodeMender编码代理首先面向政府和受信合作伙伴提供。

关键指标

  • Token效率:3.6 Flash在相同工作负载下输出Token消耗比3.5 Flash减少17%至65%,意味着企业API调用成本同比例下降。
  • 推理速度:官方宣称推理速度较前代翻倍,Flash-Lite更达到每秒350输出Token的吞吐量。
  • 定价策略:3.6 Flash定价为输入$1.50/输出$7.50(每百万Token),在全球主流AI模型中处于中低区间。
  • 旗舰延期:曾在5月I/O大会承诺6月发布的Gemini 3.5 Pro仍然跳票,Google仅称「在测试中,准备好后尽快推出」。
  • Gemini 4:Google同时透露Gemini 4已启动预训练,表明并未因Pro延期而放慢下一代研发节奏。

为什么重要

Google此次发布传递了清晰的策略信号:在旗舰模型延期的当口,通过轻量模型的快速迭代维持市场存在感和开发者生态。Token消耗的大幅降低对企业用户有直接的ROI意义,尤其是高频调用场景。

然而,Axios关于DeepMind内部士气问题的报道揭示了一个深层隐忧:军方合作项目引发的员工不满正在影响核心研发进度。如果这一问题不能有效解决,Google在旗舰模型赛道上的竞争力可能进一步落后于OpenAI和Anthropic。企业客户在选择模型供应商时,除了关注性能和价格,也需评估供应商研发团队的稳定性。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

Google连发三款Gemini轻量模型:Token消耗最多降65%,旗舰Pro仍延期|北京拓实科技