post cover

AI 热点快报:Google 连发三款 Gemini 新模型,模型路由时代来临(2026-07-22)


事件与背景

2026 年 7 月 21 日(美东时间),AI 行业经历了密集发布的一天,三条信号叠加指向同一个方向:AI 开发正在从”选一个最强模型”转向”用多个模型协同工作”。

1. Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

Google 在官方博客中一次性推出三款新模型,覆盖从边缘推理到网络安全防御的完整 Agent 工作流:

  • Gemini 3.6 Flash:定位”工作马”模型。相比 3.5 Flash,输出 token 用量减少 17%(Artificial Analysis Index),DeepSWE 基准从 37% 提升至 49%,MLE Bench 达到 63.9%。定价为 $1.50/1M 输入 + $7.50/1M 输出,低于 3.5 Flash。
  • Gemini 3.5 Flash-Lite:速度最快的 3.5 系列模型,350 tokens/s 吞吐,定价 $0.3/1M 输入 + $2.5/1M 输出。在 SWE-Bench Pro 上以 54.2% 超越 3 Flash 的 49.6%。
  • Gemini 3.5 Flash Cyber:专为网络安全的定制模型,配合 CodeMender Agent 框架使用。专注漏洞发现与修复,初期仅面向政府及可信合作伙伴开放测试。

来源:Google Blog — Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber

2. Fireworks AI 发布 Kimi K3 vs Fable 路由研究报告

Fireworks AI 对开源模型 Kimi K3(Moonshot AI)与闭源模型 Fable 5 在约 1,000 个 Agent 任务上做了系统性对比。关键发现:单一模型不再是 SoTA,通过任务路由,Kimi K3 负责 Terminal、符号数学、DevTool 场景,Fable 负责 Web、数据可视化等,路由后的组合方案在 93% 的任务中达到最优,同时成本可降低至 Fable 独自运行的 1/50。

来源:Fireworks AI — Kimi K3 is competitive with Fable; Kimi K3 + Fable is SoTA

3. Jack Dorsey 推出 Buzz:开源 AI Agent + 即时通讯 + Git 托管一体化平台

Block(原 Square)创始人 Jack Dorsey 宣布开源 Buzz,一个将团队聊天、AI Agent 工作流和 Git 代码托管整合在统一身份系统下的工作平台。基于 Nostr 协议,每个消息、工作流步骤、代码事件均使用加密签名。Agent(支持 Goose、Codex、Claude Code)与人类员工使用同一套身份和权限系统。目前标注为早期产品,移动端和推送通知等功能仍在开发中。

来源:RuntimeWire — Jack Dorsey launches Buzz to combine team chat, AI agents and Git hosting


为什么现在重要

1. Google 用三款模型覆盖了 Agent 开发的全成本曲线

3.6 Flash 解决”质量”问题,3.5 Flash-Lite 解决”规模”问题,3.5 Flash Cyber 解决”安全垂直场景”问题。这不是一次简单的版本迭代,而是 Google 明确表达:Agent 工作流需要多模型组合,而非单一全能模型。开发者可以在同一个生态内按任务选择不同性价比的模型,而不再被迫在成本和能力之间二选一。

2. 模型路由(Model Routing)从实验室走向生产

Fireworks AI 用 1,000 个真实 Agent 任务证明:将开源模型(Kimi K3)和闭源模型(Fable)路由组合,可以达到 93% 的任务最优率并降低 50 倍成本。这意味着”只用一个模型供应商”的时代正在终结。未来每个开发团队都可能维护自己的模型路由策略——就像今天用不同的云服务商部署不同工作负载一样自然。

3. Agent 身份与协作基础设施开始成型

Buzz 的出现说明:当 Agent 从玩具变成真正的团队成员时,需要什么样的基础设施——统一的身份系统、加密签名的事件日志、跨工具的工作流编排。这不是一个简单的聊天工具,而是下一代”开发环境操作系统”的雏形。Dorsey 将 Agent 视为与人类员工同等的”事件参与者”,这一设计哲学可能会影响未来所有生产力工具的设计。

4. 安全性获得了专属模型

Google 专门发布一个”网络安全模型”(3.5 Flash Cyber),且初期限制到政府和可信合作伙伴。这标志着:AI 安全正在从”事后修补”转向”前置定制”。模型本身嵌入安全能力,而非依赖外围防护层。对于企业级开发者来说,这暗示了未来会有更多垂直安全模型(合规、隐私、审计)的出现。

5. 定价竞争进入”微利”阶段

3.5 Flash-Lite 以 $0.3/1M 输入的定价进入存量推理市场。结合 3.6 Flash 的”更少 token 完成同样任务”的优化策略,模型提供商的竞争点已从”谁能做得更好”转向”谁能在同样质量下做得更便宜”。


工程师/产品人今天能做什么

  1. 测试 Gemini 3.6 Flash 的 Agent 能力:如果你的产品依赖多步推理或代码生成(如自动 PR review、代码迁移工具),立即在 Google AI Studio 中测试 3.6 Flash。重点看 DeepSWE 和 Terminal-Bench 两类场景,这两块是本次升级的核心。

  2. 实验模型路由架构:不要只绑定一个模型。用 Fireworks 或其他推理平台搭建简单的路由层——简单任务走 3.5 Flash-Lite,复杂推理跑 Kimi K3,前沿研究任务用 Fable/Claude。这周就可以手工配置一个 if-else 路由,下周考虑基于 embedding 相似度的动态路由。

  3. 关注 Agent 身份基础设施:如果你在构建多 Agent 系统,研究 Buzz 的 Nostr 签名事件架构。即使不迁移到 Buzz,其设计思路——Agent 有独立密钥、所有动作可审计、人与 Agent 使用同一权限模型——应该成为你系统的安全基线。

  4. 重新评估成本模型:用 Google 的新定价表和 Fireworks 的路由成本数据重新计算你当前推理管道的 TCO。很多场景下,用多个便宜模型组合可能比一个贵模型更省钱且更准确。

  5. 关注 Google 的 Cyber 模型试点:3.5 Flash Cyber 目前仅限政府与合作伙伴访问,但 CodeMender 框架本身值得研究。如果你的产品涉及代码安全审计,跟踪这个方向的后续开放进度。


待观察

  1. Gemini 3.5 Pro 何时到来? Google 在博客中明确提到 3.5 Pro 正在与合作伙伴测试中。完整的大模型产品线(Pro + Flash + Flash-Lite + Cyber)何时对齐公开?对现有 API 用户意味着版本升级还是额外支出?

  2. 模型路由方案是否出现标准协议? Fireworks 的路由是专有实现。如果路由成为主流模式,行业是否需要类似 OpenRouter 但更具标准化(带策略层)的协议?Google 的 Managed Agents 已经在暗示这个方向。

  3. Buzz 能否突破”自家狗粮”阶段? Buzz 目前唯一的客户是 Block 自己。当它面对成熟的 Slack + GitHub + 自建 AI 工具链时,开源能否弥补功能上的差距?首个外部付费客户将是关键的信心指标。