发生了什么
7月21日,Google DeepMind发布了三款Gemini Flash系列新模型,定位清晰、分层明确:Gemini 3.6 Flash面向编程、知识工作与多模态任务,是主力升级款;Gemini 3.5 Flash-Lite主打高吞吐低延迟,每秒可生成350个输出Token,适配文档处理等高流量场景;Gemini 3.5 Flash Cyber则专注于安全领域,通过CodeMender编码代理首先面向政府和受信合作伙伴提供。
关键指标
- Token效率:3.6 Flash在相同工作负载下输出Token消耗比3.5 Flash减少17%至65%,意味着企业API调用成本同比例下降。
- 推理速度:官方宣称推理速度较前代翻倍,Flash-Lite更达到每秒350输出Token的吞吐量。
- 定价策略:3.6 Flash定价为输入$1.50/输出$7.50(每百万Token),在全球主流AI模型中处于中低区间。
- 旗舰延期:曾在5月I/O大会承诺6月发布的Gemini 3.5 Pro仍然跳票,Google仅称「在测试中,准备好后尽快推出」。
- Gemini 4:Google同时透露Gemini 4已启动预训练,表明并未因Pro延期而放慢下一代研发节奏。
为什么重要
Google此次发布传递了清晰的策略信号:在旗舰模型延期的当口,通过轻量模型的快速迭代维持市场存在感和开发者生态。Token消耗的大幅降低对企业用户有直接的ROI意义,尤其是高频调用场景。
然而,Axios关于DeepMind内部士气问题的报道揭示了一个深层隐忧:军方合作项目引发的员工不满正在影响核心研发进度。如果这一问题不能有效解决,Google在旗舰模型赛道上的竞争力可能进一步落后于OpenAI和Anthropic。企业客户在选择模型供应商时,除了关注性能和价格,也需评估供应商研发团队的稳定性。

