才三周Flash就换代!谷歌上新两款Gemini 3.8:编程与推理能力升级,向RSI迈出一大步

  谷歌又一次加快了 Gemini 模型的迭代速度。

  美东时间 9 月 2 日周三,谷歌宣布推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款新模型,分别瞄准长周期编程、智能体工作流与复杂推理,以及网络安全漏洞发现和自动修复。谷歌称,Gemini 3.8 是其迄今“最强的推理和编程模型”,两款模型均通过长时间运行的智能体循环,不断评估和优化任务执行结果。

  谷歌 DeepMind 研究员姚顺宇在模型发布后评价道:"对模型而言,这只是迈出了一小步;但对于 RSI(递归自我改进)来说,这是一次巨大飞跃。"

  这句话揭示出谷歌当前技术路线的核心逻辑:让 AI 模型具备足够强的代码能力,从而使其能够参与自身乃至下一代模型的研发过程,最终打通整个研发闭环。

  距离上一代 Gemini 3.7 Flash 发布仅过去三周,谷歌就再次推出新版本。谷歌表示,此次是其六周内第三次发布 Flash 模型;独立 AI 基准测试机构 Artificial Analysis 则指出,3.8 Flash 已是谷歌不到四个月内推出的第四款 Flash 模型。

  在性能提升的同时,谷歌继续维持低价策略:Gemini 3.8 Flash 的引导价格与 3.7 Flash 相同,为每百万输入 Token 0.75 美元、每百万输出 Token 3.75 美元,优惠持续至今年年底。Artificial Analysis 评测显示,3.8 Flash 高推理档在其综合智能指数中获得 59 分,较 3.7 Flash 提高 3 分,并以每项任务约 0.58 美元的成本进入“智能程度—任务成本”性价比前沿。

  从长周期编程到自主智能体,3.8 Flash 更强调“把事做完”

  Gemini 3.8 Flash 此次的核心升级,是从单次代码生成进一步转向长周期的软件工程和自主智能体。

  谷歌表示,3.8 Flash 在 DeepSWE v1.1 长周期软件工程测试中,能够自主解决复杂工程问题并完成端到端任务,表现超过多数规模更大的前沿模型。与此同时,新模型在金融、法律等专业领域的智能体测试中也有所提升,在 HLE-Verified 测试中的得分达到 54.9%。

  这背后的关键变化,是谷歌让模型“做得更多”。

  面对复杂任务时,3.8 Flash 被设计为执行额外的推理步骤,并持续迭代调用工具。当模型遭遇不确定性时,它不会直接输出低置信度答案,而是通过消耗更多 Token 在内部完成自我验证与反思。由于基础单价极低,即便经过多轮循环迭代产生了更多 Token 消耗,整体调用成本仍低于直接调用 GPT-5.6。

  这一设计哲学与 RSI 的核心逻辑高度吻合:一个能够在 Agent 循环中快速、廉价地反复迭代的模型,天然具备参与自动化研发流程的条件。

  谷歌的逻辑是,速度与极低的推理成本本身就是一种智力形态——在一个完整的 Agent 工作流中,每秒钟完成更多次推理循环,效果上等同于提升了模型的实际解题能力。

  谷歌展示的案例也更加接近实际生产环境,包括通过 Antigravity 仅凭一个提示生成可运行的 3D 游戏、生成能够运行的 DOS 版 Google Maps,以及在 AI Studio 中生成硬件拆解的交互式 3D 可视化工具。

  这也意味着,Flash 系列的定位正在发生变化:它不再只是一个追求速度和低成本的“小模型”,而是逐渐成为谷歌推动 AI 智能体落地的重要底层模型。

  独立评测:智能指数升至 59 分,但“多做事”也意味着更高 Token 消耗

  Artificial Analysis 的独立测试进一步印证了 3.8 Flash 的能力提升。

  该机构数据显示,Gemini 3.8 Flash 高推理档的 Artificial Analysis Intelligence Index 得分为 59 分,比 3.7 Flash 的 56 分高 3 分;中推理档得分 57 分,低推理档则为 52 分。高推理档的输出速度约为 305 Token/秒,位居其评测模型前列。

  不过,性能提升并非完全没有代价。

  Artificial Analysis 指出,虽然谷歌维持了 3.7 Flash 的 Token 价格,但 3.8 Flash 高推理档每项任务的实际成本约为 0.58 美元,较 3.7 Flash 的 0.40 美元高约 40%。原因在于,新模型平均每项任务的输出 Token 数量增加约 30%,同时智能体评测中的交互轮数也有所增加。

  换句话说,单价没有上涨,但模型为了完成更复杂的任务“思考得更多、调用得更多”,实际使用成本反而有所增加。

  这也解释了谷歌为什么同时保留不同推理档位。Artificial Analysis 数据显示,3.8 Flash 中推理档每项任务成本约 0.41 美元,低推理档约 0.24 美元。对于追求成本效率的应用,开发者可以降低推理强度,或者继续使用 3.7 Flash。

  3. 8 Flash Cyber 瞄准网络安全:漏洞发现与自动打补丁

  与通用版 3.8 Flash 同步发布的,是专门面向网络安全领域的 Gemini 3.8 Flash Cyber。

  谷歌称,新模型具备“前沿水平”的漏洞发现和自动修复能力,并重点强化了防御侧应用。其在 CyberGym 行业基准中的漏洞自主发现表现超过 Gemini 3.5 Flash Cyber 以及规模明显更大的前沿模型。

  在谷歌内部覆盖 20 种编程语言的真实漏洞测试中,3.8 Flash Cyber 的成功率超过 70%;在 CWE-Bench 自动补丁测试中,pass@1 达到 47.2%,接近领先前沿模型的 47.8%,但成本明显更低。

  谷歌还公布了几个实际应用案例。

  Chrome 安全团队发现,3.8 Flash Cyber 生成的正确漏洞补丁数量,是规模更大的商业模型的 2.6 倍;网络安全公司 Wiz 的内部渗透测试显示,该模型的召回率比其他前沿模型高 7.5 至 9.7%,成本则低 2.3 至 5.2 倍。

  谷歌云漏洞研究团队甚至利用该模型在不到两小时内发现了一项关键基础设施漏洞,而谷歌称这类漏洞过去通常需要数月才能完成研究和发现。

  Fairwind 计划启动,650 多家机构获网络安全 AI“优先通道”

  伴随 Gemini 3.8 Flash Cyber 发布,谷歌还推出了 Fairwind 计划,将网络安全 AI 进一步推向政府、关键基础设施和大型企业。

  根据谷歌公告,Fairwind 是一个限制访问的项目,面向政府机构以及可信赖的云客户和网络安全合作伙伴开放。参与者可以使用 Gemini 3.8 Flash Cyber,并结合谷歌的 CodeMender 工具,实现漏洞发现、验证和自动修复。

  谷歌表示,参与机构需要将模型访问权限限制在内部网络安全、事件响应或渗透测试团队,并部署多因素身份验证等安全措施。目前 Fairwind 已经拥有超过 650 家全球合作伙伴,覆盖政府、关键基础设施以及核心技术平台。

  这意味着谷歌此次并不只是发布一个网络安全模型,而是在尝试建立一个面向防御方的 AI 安全生态。

  尤其值得注意的是,谷歌强调 Fairwind 将首先为政府和对社会韧性至关重要的企业提供访问权限,包括医疗、电信、能源和金融等关键基础设施运营商,以及维护广泛软件基础设施的技术平台。

  Flash 高频迭代,谷歌押注“更便宜的智能体”落地

  从 3.6 Flash 到 3.7 Flash,再到如今的 3.8 Flash,谷歌正在明显加快 Flash 系列的更新节奏。

  而与早期 Flash 模型强调“快”和“便宜”相比,如今的 3.8 Flash 更加突出长周期推理、工具调用、软件工程和自主智能体能力。谷歌试图证明的是:不一定需要最大规模的模型,才能完成越来越复杂的真实工作。

  价格则成为谷歌扩大这一战略的重要杠杆。

  3. 8 Flash 继续维持每百万输入 Token 0.75 美元、输出 Token 3.75 美元的年底前引导价格,同时提供 1M Token 上下文窗口,并支持文本、图像、语音和视频输入。消费者可以通过谷歌 AI Pro 和 Ultra 订阅使用,开发者则可以通过 Antigravity、谷歌 AI Studio 和 Android Studio 调用,企业用户可通过 Gemini Enterprise 使用。

  对于谷歌而言,这种策略的意义在于:在 AI 竞争从“谁的模型最强”逐渐转向“谁能让智能体以合理成本完成更多实际任务”的过程中,Flash 系列可以凭借成本和速度优势抢占更大规模的应用入口。

  而此次同时推出通用智能体模型和网络安全专用模型,也显示谷歌正在把 Gemini 的竞争重点从单纯的聊天和问答,进一步推向编程、企业工作流以及能够直接创造经济价值的 AI 执行任务。