过去几个月,Gemini 在中文互联网上多了一个颇具杀伤力的外号:“美国大豆包”。
这个称呼吐槽的,是 Gemini 身上长期存在的反差:发布会上基准成绩漂亮、上下文窗口巨大、免费额度充足,真正用起来却偶尔理解跑偏,一本正经地给出错误答案。
被用户指出问题后,它还可能先送上一大段夸奖和道歉,情绪价值给得很足,事情却没有办好。
在 Gemini 3.5 Flash 发布后,这种调侃一度升级为:“这是最快告诉你错误答案的 AI。
” 如今,Google 带着 Gemini 3.8 Flash 回来了。
这是其六周内推出的第三款 Flash,也是不到四个月内的第四次 Flash 更新。
新模型在 Artificial Analysis Intelligence Index 上获得 59 分,与 xhigh 档位下的 GPT-5.6 Sol 和 medium 档位下的 Grok 4.6 持平;在 DeepSWE v1.1 上,它甚至超过大多数体量更大的前沿模型,登上长程软件工程榜首。
更关键的是,Gemini 3.8 Flash 仍能保持每秒约 300 Token 的输出速度,约为许多主流模型的 4—6 倍。
“美国大豆包”这次似乎真的变聪明了。
Google 没有直接把 Flash 做成一款缩小版 Pro,而是让模型思考更多、反复调用工具、执行更多轮次,并为此消耗更多 Token。
一款模型可以拥有极高的 Token 输出速度,每项评测任务的加权生成时间却比上一代更长。
理解这组看似矛盾的数据,才是理解 Gemini 3.8 Flash 的关键。
Flash 冲进第一梯队 自 2026 年初以来,Google 一直没有发布前沿级别的 Gemini Pro 模型。
原本承诺在今年 6 月推出的 Gemini 3.5 Pro 至今没有出现,据称原因之一是它的编程能力未能达到 Google 的预期。
8 月初,Google DeepMind 的管理层也发生变化。
Demis Hassabis 卸任 CEO、转任董事长,Koray Kavukcuoglu 接过管理工作,职衔则变成了高级副总裁。
Google CEO Sundar Pichai 随后试图安抚外界,但这并没有完全消除市场的疑虑:Google 是否还准备继续争夺前沿模型的最高位置?
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜