你还在等 GPT-4o 的响应转圈?Google 刚刚把推理速度又推上一个台阶。OpenRouter 今天同时上线 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite,150+ tok/s 不是纸面参数,是两个模型直接把吞吐量写进了现实——智能体、编码、高并发子智能体,这些过去被延迟绑住手脚的场景,终于有了能跑起来的轮子。
速度即正义:150 tok/s 对智能体到底意味着什么
不只是“快一点”
很多评测把高吞吐量理解成“用户体验更好”,少等两秒。这太表面了。当一个智能体需要连续调用工具、读取返回结果、再做下一步行动,每一步之间都会叠加思考延迟。100 tok/s 和 150 tok/s 的区别,不是 1.5 倍体感加速,而是链路是否会被打断。在实际的编码 agent 里,模型需要吐出整段函数、接收 LSP 报错、修正、再输出,这个过程如果出现单一环节的卡顿,整个思维链就会被切断,之前上下文对后续的引导力急剧衰减。高吞吐量在这个时候不是为了省时间,是为了保连贯。Gemini 3.6 Flash 在这条线上明显向前了一步。
子智能体并发,吞吐量决定架构天花板
现在稍微严肃一点的 agent 架构都在拆分子智能体:一个负责规划,一个负责检索,一个负责执行。并发越高,总吞吐量的上限就越关键。如果每个子智能体调用都要排队等 token 生成,并发的好处直接被吃光。150+ tok/s 的单路速度意味着你可以在同一个生命周期里并行挂载更多 sub-agent,不用提前焦虑速率限制。对那些采用 fan-out 模式、一次任务就要并行生成大量候选方案的工程团队来说,这个数字直接决定了他们能不能丢掉复杂的缓存层和预生成策略。轻则优化成本,重则改架构。
Flash 与 Flash-Lite:两个模型,两种成本逻辑
Gemini 3.6 Flash:编码与知识工作的速度怪兽
没有意外的话,3.6 Flash 会成为编码类场景的新基准候选。它承接了 Flash 系列的密集 token 生成传统,但在长上下文推理上的抖动明显比上一代更小。早期跑过内部测试的开发者反馈,它在生成结构化输出(比如完整类定义、带注释的函数块)时,极少出现中途风格漂移。这对嵌入 CI/CD 管道的 AI 工具来说太要紧了——你不需要再花额外 token 去纠正格式错误。而且推理速度拉起来之后,原本需要分段完成的大文件,可以一次生成再局部修正,交互模式会从“一步步盯着改”变成“整体生成-审查”。
Flash-Lite:低成本、高并发子智能体的正确选择
Gemini 3.5 Flash-Lite 的定位清楚得不像 Google 的风格。它不是给终端用户聊天用的,是给子智能体跑量的。如果你有一条流水线,其中 80% 的调用是简单的实体抽取、意图分类、简短摘要,这些任务对模型深度要求不高,但对调用次数极度敏感,那么 Flash-Lite 几乎是为这种场景定制的。成本压在极低水位,延迟却依然在 Flash 系底盘上,不会因为廉价就退回毫秒时代。高并发、低时延、可接受推理质量,这种三元组合在目前的托管市场上还是稀缺货。
OpenRouter 即时上线,开发者少踩的坑不止是部署
一个 API,模型随便换
每次新模型发布,最耗神的事不是读技术报告,是配环境、调参数、测兼容性。OpenRouter 的做法直接把这些步骤压缩成一行模型名切换。你不需要为 Gemini 3.6 Flash 单独申请 Google Cloud 权限,不用管配额审批,甚至不用理机器区域。对那些并行评估多个模型的工作流来说,这种“即插即用”带来的时间节省比那几十毫秒的推理延迟重要一个数量级。况且,150 tok/s 的速度也只有透传层足够薄时才不会被吃掉,OpenRouter 在这次上线同步时明显做了路由优化。
隐含信息:Google 的模型分发策略在变
以前 Google 发新模型,首发渠道多半是自己的 Vertex AI 或者 AI Studio 预览,第三方托管平台通常是第二梯队。这次 OpenRouter 几乎同步上线,本身就是一个信号。Google 开始把开发者接入速度当成竞争力,不再层层包裹。对社区来说这意味着后续的 Flash Pro 甚至 Ultra 型号未来也可能走相同路径——先让写代码的人用起来,再谈别的。对于已经跑在 OpenRouter 上的 agent 项目,这种节奏意味着他们有机会在正式发布前就完成集成测试,把创新周期压缩到以前不敢想的程度。
模型齐发,但真正的分水岭在吞吐量和成本
150+ tok/s 会成为 agent 场景的新入场券
过去一年,大模型竞赛的主轴是长上下文窗口和多模态支持。但现在窗口已经拉得足够长,图片、音频都吃进去了,剩下的硬骨头就是延迟和成本。在 agent 落地的真实环境中,延迟不是一个体验指标,是功能指标。如果模型不够快,你只能让 agent 做离线性任务,实时交互的闭环根本跑不起来。Gemini 3.6 Flash 这次把门槛提到 150 tok/s,等于给后续所有想进入 agent 市场的模型画了一条明线——达不到这个速度,就别谈实时多步推理了。
低成本模型不再等于“差的模型”
Flash-Lite 的出现正在改写“轻量”的定义。以前的轻量模型通常意味着你要在输出质量上做出明显让步。但现在,随着蒸馏技术和训练数据的改进,Flash-Lite 在限定任务上的表现没有出现断崖式下降,反而在保持基本质量的同时把价格打了下来。它促使开发者重新思考模型分发策略:核心链路用 3.6 Flash,周边任务用 Flash-Lite 兜底。这样一套组合的总体成本,可能比单独调用一个通用模型还要低,而且性能更可控。
接下来会发生什么
Agent 框架会把这两个模型作为默认参考配置
可以预见,像 LangChain、CrewAI、AutoGen 这些框架会很快把 Gemini 3.6 Flash 加入推荐列表。不是因为它来自 Google,而是因为它的速度/成本比确实站在了一个新的甜点区。对于这些框架来说,他们一直苦于缺乏一个能在演示阶段同时撑住效果和速度的模型,3.6 Flash 正好补上了这一环。更不提 Flash-Lite 给了他们一个合理的“轻量代理”选项,不用再硬塞一个重模型去跑简单任务。
编码类 AI 工具可能迎来一轮速度升级
那些已经集成 OpenRouter 的编码工具,比如 CodeCompanion、Continue 分支版、各种 VS Code 插件,今天起可以直接切换后端到 Gemini 3.6 Flash。一块代码补全如果从 1.5 秒缩短到 0.8 秒,开发者的打断感会大幅降低。这种流畅度升级比任何模型精度提升都更能黏住用户。如果 Google 后续继续开放更大的上下文窗口且不压缩速度,IDE 内全文件重构将不再是偶发操作,而可能成为常规交互。
Gemini 3.6 Flash 和 3.5 Flash-Lite 这次的 OTA 式上线,比一次隆重发布会透露了更多东西。Google 正在用速度和不打折扣的分发,给 agent 生态喂它最缺的东西:确定性。快,是很扎实的商业壁垒。

