Gemini 3.8 Flash 光速发布:干活挺勤快,就是没开窍

以近乎下饺子的速度,Gemini 又双叒更新了。
今天凌晨,Gemini 3.8 Flash 正式上线。这已经是 Google 在六周之内发布的第三款 Flash 模型。
看起来,Google 要把「小步快跑」的战略贯彻到底。但我比较担心的是,按这个速度,在 Gemini 4 出来之前 3.x 的版本号好像不太够用了…… 从版本号上看这只是一个常规更新,但 Google 给 Flash 系列模型安排的任务却越来越重。官方说法称,它的目标是编写和修改大型项目、反复调用工具、独立完成持续数小时的复杂工作。
这些一般用来衡量顶级 Agentic 模型的活儿,如今都委派给了 3.8 Flash。Flash 系列原本的意义是跑得更快、花得更少,但现在,它不得不代替迟迟没有出现的 3.5 Pro,证明 Google 仍有能力留在牌桌上。
看官方跑分,Google 似乎真的做到了;但社区反馈和我们的简单测试得出了一个相反的结论: 六周连更三代,Gemini 3.8 Flash 依然「圣质如初」。三周一个新模型,跑分已逼近 Opus 5 Google 将 Gemini 3.8 Flash 称为「迄今最聪明的 Flash 模型」,主要面向长程软件工程、自主 Agent 和复杂企业工作流。
话都这样说了,那最显眼的提升自然是编程。在测试长程软件工程能力的 DeepSWE v1.1 中,Gemini 3.8 Flash 拿到 71.0% 的成绩,相比 3.7 Flash 的 65.3% 又提高了近 6 个百分点,距离 Claude Opus 5 的 74.0% 只剩一步之遥——要知道,一个半月以前的 3.6 Flash 只有 49%。
而在跨越 STEM、人文和专业知识的 HLE-Verified 中,3.8 Flash 得分 54.9%,略高于 Opus 5 的 54.4%。
在部分多模态测试中,优势甚至更为明显:复杂图表理解测试 CharXiv Reasoning 得分 86.2%,超过 Opus 5 的 83.7%;采用 Agent 模式处理长视频时,LVBench 得分达到 87.8%,更是碾压 GPT-5.6 Sol 和 Opus 5 在内的一众顶级模型。金融和法律也是 Google 重点宣传的方向。
3.8 Flash 在 Vals Finance Agent V2 和 Harvey’s Legal Agent Benchmark 中均超过 3.7 Flash 及其他更昂贵的前沿模型。只看这些数字,一款价格远低于 Opus 5 的 Flash 模型,似乎已经在编程、图表、视频和部分专业任务中摸到了旗舰模型的门槛。
好消息是,这些能力提升算是「免费升级」,因为 3.8 Flash 和不久前发布的 3.7 Flash 价格保持一致:每百万 Token 输入 0.75 美元,输出 3.75 美元。原则上这只是限时优惠价格,2027 年 1 月 1 日起,输入输出价格将分别恢复至 1.5 美元和 7.5 美元。
其实早在 3.6 Flash 发布时,Google 就说过这优惠价只会持续到年底;但现在看来,他们更新模型的速度已经明显快过更新价格。说不定这个优惠政策,能熬走四五代模型。Google 解释称,3.8 Flash 之所以能完成更困难的任务,主要是因为它「更加努力」。
也就是说,面对复杂问题时,它会执行更多推理步骤、反复调用工具,并在过程中检查自己的工作。代价是,它可能比 3.7 Flash 消耗更多的 Token。Google 甚至建议,如果任务更重视计算效率,可以选择降低推理档位,或者继续使用 3.7 Flash。
从这个角度来看,3.8 Flash 所谓的更强,似乎有相当一部分来自这种推理上的「强制超频」。与 3.8 Flash 一起发布的还有 3.8 Flash Cyber。在顶尖大模型越狱发动攻击已经变成一种新的 benchmark 的当下,Cyber 可以说是专门给网络安全机构和网络基础设施维护者用来发现、修复漏洞的专用「补锅匠」。
Google 表示,在一项覆盖 20 种编程语言的内部漏洞发现测试中,其成功率超过 70%。不过,这款模型只通过 Fairwind Program 提供给可信的网络安全机构,普通用户还是接触不到。速度很 Flash,结果也还是 Flash 为了彰显对 3.8 Flash 的宣传所言非虚,Google 在官方博客中准备了几段炫技演示。
其中一个是完整的 3D 魔法城堡。玩家扮演巫师在城堡中探索,场景里包含谜题、环境叙事、可交互物品和完整关卡,纹理由 Nano Banana 负责生成。另一个案例则把 Google Maps 塞进了 DOS 界面。
它复刻了早年的计算机视觉风格,功能相当完善,可以搜索地点、规划路线,甚至进入街景界面。至少从官方视频来看,这些已经是具备交互功能和基本产品逻辑的完整 Demo 了。但 Google 说的话吧,我们也就姑且听听,毕竟前天他们还向《华尔街日报》爆料称内部工程师编程时更喜欢用 3.8 Flash 而不是 Opus 5…… 结果怎样,还是要实测了才知道。
所以,我们也拿了两个类似的任务,简单测试了下 3.8 Flash 的成色。第一项测试是利用 Three.js 搭建一个空客 H145 直升机的 3D 模型。3.8 Flash 没让我等太久,仅用不到一分钟就拆解完了需求,然后以恐怖的速度倾泻出代码;又过了 109 秒,场景和模型就都做好了。
单从生成速度来看,它的确对得起 Flash 的名头。但打开看结果,有点不对劲了。功能倒是齐全的,基本光照也有,但机身细节、部件关系和运动方式都相当粗糙。
跑是能跑,但和 H145 直升机的关系约等于鸡仔饼与鸡仔的关系。一直有看爱范儿的读者应该熟悉,这正是昨天我们报道 Fable 5.1 时援引过的测试案例。怎么说呢?由奢入俭难啊…… 第二项测试是 3D 水流模拟,要求设置可替换的地形,来模拟降雨和地表径流在地形上的移动。
同样是两分钟做出来,但这个火山口好像有点漏水…… 这类结果的微妙之处在于,它在工程上确实不是完全失败。任务能结项,代码通常能运行,要求的功能也齐全,但显然离官方案例有着肉眼可见的距离。X 上的首批用户反馈也出现了类似分裂。
一方面,3.8 Flash 的响应速度普遍得到认可;但与此同时,它在真实编程和生成任务中依然容易草率理解需求,迅速交出一个形式完整、但细节一塌糊涂的结果。这未必就代表着 Google 伪造了跑分。更有可能,官方和用户测试已经是完全不同的使用方式。
在魔法城堡的案例里,官方明确提到,它是由 3.8 Flash 在 Antigravity 中通过循环指令持续工作,并调用 Nano Banana 生成了场景纹理。换句话说,官方样例里模型通常有专门设计的 Agent 框架、工具环境和明确的多轮测试标准,而我们用的时候,通常只是给它一段一次性的自然语言指令。
Google 展示的是 3.8 Flash 被整套技术栈托举之后的上限;我们接触到的,是模型单独工作时的下限。因此,3.8 Flash 有可能是个不错的 Agent 零件,但离单独撑起一套可靠的自主工作流还有距离。更值得注意的是,Google 声称 3.8 Flash 会更认真地推理、调用工具和检查结果,但实际体验很难感受到这种「勤奋」。
哪怕将推理等级调到最高,它给人的感觉也不是深思熟虑规划后作答,而是快速堆出一个能交差的结果。Google 原本想证明,Flash 模型也能在部分场景干旗舰模型的重活,但至少现阶段,它的判断力、稳定性和完成度和旗舰模型相比还是有很明显的差距。
模型之间,等级森严。Google 不争第一,反而可能赢得更多 就在 3.8 Flash 发布前一天,Google AI Studio 负责人 Logan Kilpatrick 放出了一段与 Google DeepMind 新掌门人 Koray Kavukcuoglu 的访谈。
Koray 在采访中承认,Google 当前的模型「略低于前沿」,但也相当直接地回应了外界关于 Google 已经放弃最强模型竞争的说法: 除了站在前沿,没有别的事情对我们更重要。我百分之百确定,我们会回到前沿。除了站在前沿,没有别的事情对我们更重要。
我百分之百确定,我们会回到前沿。但表态和现实是两回事。爱范儿此前获悉,Gemini 3.5 Pro 交付失败之后,Google 短期内不再押注 Fable、Opus 级别的超大规模模型,而是将更多资源转向成本更低、迭代更快的 Flash。当然,这不代表 Koray 说的是空话。
Gemini 4 仍然承担着带领 Google 重返第一梯队的长期目标,但不在第一梯队,人也是要吃饭的——在那之前,Flash 要负责守住用户、产品、开发者和收入。不过,「前沿」有时是一种诅咒。
OpenAI 即将推出的 Astra 已经达到了所谓「关键级」网络安全能力,可以在较少人工介入的情况下发现未知漏洞;研究者也担心,下一代模型可能逐渐采用越来越难观察内部推理过程的架构,让依靠思维链监控危险行为变得更困难。
Anthropic 的 Fable 5.1 则展示了另一种代价——它的能力大幅领先,但社区反馈表示,长任务、子 Agent 和复杂工作流甚至会在两个简单问题后就吞噬掉 Max 订阅计划的五小时额度。当前沿模型继续前进,它们带来的还有更难控制的能力、更昂贵的推理过程,以及监管机构的巨大压力。从这个角度来看,3.5 Pro 的失败未必完全是坏事。
转向 Flash 以后,Google 可以将数月一次的前沿模型豪赌,变成像普通软件一样持续更新。新的 Flash 模型可以迅速进入 Gemini App、AI Studio、Antigravity 乃至 Google 搜索,在真实使用中暴露问题,再以「周更」的节奏修修补补。如果 3.5 Pro 没有失败,Google 未必会这么决绝地走上这条路。
Gemini App 的月活跃用户已经超过 10 亿,成为 Google 历史上增长最快的产品;从去年五月至今,它增加了约 6 亿用户。可见,增长不需要最强的模型。大多数人不会让 AI 独自连续工作九个小时,也不会要求它发现零日漏洞。
他们只是想搜索资料、修改照片、总结邮件、做心理咨询或者写一篇小说给自己看。这种时候,没有被长程任务优化污染的 Gemini,反而能写出更好的文字。即将在中国市场补上空缺的 Apple Intelligence 也是如此。
它首先要解决的是通知、文本、图片、Siri 和跨应用操作问题,而非在 benchmark 中击败谁。对于要被塞进数亿台手机、浏览器和办公软件的 AI 而言,速度快、成本低、能够高并发运行,比拿下排行榜第一更重要。退出最强模型的消耗战,可能是一门更轻松的生意。
可这也意味着,在 Gemini 4 真正出现之前,为 Google 技术力代言这项工作只能由 Flash 强行顶上。于是,Gemini 3.8 Flash 成了一款绝无仅有的奇怪模型。它既要足够快、足够便宜,塞进搜索、手机和十亿人的日常;又要像旗舰模型一样长时间工作、反复调用工具,承担复杂编程和 Agent 任务。
理想很美,现实很糟。两种相反目标的张力之下,3.8 Flash 只能在官方跑分里冒充一会儿 Pro 的样子。