Gemini 3.8 Flash跑分追平Opus 5,实测差口气
9月2日,Google发布Gemini 3.8 Flash,输入0.75美元、输出3.75美元每百万token,官方称这是“迄今最聪明的Flash模型”。这也是Google在六周内发布的第三款Flash模型——上一款3.7 Flash发布于8月13日,再上一款3.6 Flash在7月21日。
跑分层面,这次不是厂商自说自话。第三方评测机构Datacurve的DeepSWE v1.1榜单在9月2日更新,gemini-3.8-flash(high档位)以74%(±1%)与claude-opus-5(max档位)的74%(±4%)并列榜首,而完成单个任务的平均花费是2.36美元,Opus 5为11.84美元。
但另一头,实测反馈明显降温。爱范儿同日发布的两款实测里,3.8 Flash能在两三分钟内生成可运行的3D场景代码,结果却是“能跑但不对”:直升机模型的部件关系和运动方式粗糙,水流模拟的地形“漏水”。第三方榜单的高分和开发者的体感之间,到底哪一段是真的?
第三方榜单证实了跑分,也证实了便宜在哪
DeepSWE v1.1不是Google的自设考题。它由Datacurve发布,113道任务分布在91个开源仓库、5种语言上,所有模型统一跑在mini-swe-agent框架下,任务全部从零编写以规避数据污染。相比主流代码基准SWE-bench Pro,它的参考答案平均要写668行代码、改7个文件,更接近真实工程改动。
在这张榜单上,Google的迭代曲线相当陡:gemini-3.5-flash为36%,3.6 Flash为47%,3.7 Flash为65%,3.8 Flash直接跳到74%,四档之间只隔了不到半年。
另一家独立评测机构Artificial Analysis的口径也印证了其性价比:智能指数59分(同类模型中位数36),每秒输出302个token,上下文窗口100万token,完成一个标准化任务的加权成本0.58美元。它的结论很直白:同级中智能领先且价格有竞争力,但“非常啰嗦(very verbose)”。
“啰嗦”这个词,恰好是理解整场发布的关键。
分数怎么追上去的:确实“更努力”,也更费token
Google在博客里把性能来源归于一句设计选择:“3.8 Flash works harder”——在复杂任务上执行更多推理步骤、反复调用工具。官方同时提醒,高推理档位下模型可能消耗更多token换取性能;若算力成本是首要约束,开发者可调低推理档位,或继续用仍在支持的3.7 Flash。
把这句官方表述放到数据上看,代价变得可量。Datacurve榜单里,3.8 Flash解题用了166个步骤、平均输出14.3万token;Opus 5只用99步、11.8万token就拿到同样分数。也就是说,3.8 Flash的高分是靠更长链条的自主试错堆出来的,而不是“同样的活儿干得更省”。
Artificial Analysis的统计更直观:完成其智能指数测试,3.8 Flash共输出1.2亿token,同类模型中位数是7100万。Hacker News上不少开发者指出这一点,有人称3.8比3.7平均每个任务多输出约1.1万token,也有人认为其输出量接近3.7的两倍。这些都是个体阅读数据面板后的判断,不构成统计结论,但指向同一个问题:单价低不等于总价低。
所以“比旗舰便宜十倍”这种说法要拆开看。按token单价算,3.8 Flash输出3.75美元/百万token,确实只是旗舰模型的零头;按真实任务算,DeepSWE上它单任务成本约为Opus 5的两成、GPT-5.6 Sol(6.46美元)的三分之一。省钱是真的,但省的是“把活干完的总账”,不是每句话的报价。
还有一点被普遍忽略:0.75/3.75美元是限时优惠价,Google在博客中称之为“introductory price”。爱范儿援引价格信息称,2027年1月1日起将恢复至输入1.5美元、输出7.5美元每百万token,作者同时提醒3.6 Flash时Google曾表示优惠价只到年底。这个价格窗口本身,就是一个迁移诱因。
跑分环境和用户指令之间,隔着一整套技术栈
回到那个核心矛盾:为什么榜单第一,用起来却“能跑但不对”?
先看跑分的条件。DeepSWE的113道题跑在同一套agent框架里,模型可以反复探索代码库、自验证、修正,直到通过测试。这是“长程自主执行”的成绩,前提是有harness托底。
再看Google官方案例。官方博客展示的3D魔法城堡,是在Google Antigravity里用循环指令生成、纹理调用Nano Banana完成;DOS版Google Maps号称“单一提示词”,同样运行在Antigravity环境中。这些案例的完整程度,建立在一整套工具链与多轮调优之上。
爱范儿的实测路径恰好相反:只给一条自然语言指令,不提供工作流、不循环优化、不调用外部生成工具。作者给出自己的解释——Google展示的是“被技术栈托举的上限”,用户接触到的是“模型单独工作的下限”。爱范儿还提到,即便把推理等级调到最高,体验上感受不到深思熟虑,更多是快速堆出交差结果。这属于作者主观观察,但至少说明一件事:推理档位高不等于输出质量高,档位在多数场景下放大的是过程长度,而非判断力。
一个补充信息有助于理解边界:按官方口径,3.8 Flash面向消费者只在Gemini App、搜索AI Mode与Sheets中开放给Google AI Pro和Ultra订阅用户,免费用户接触到的模型并非同一批。个体反馈的样本差异,也部分来自这里。
六周三款Flash,Google真正在押什么
发布节奏本身是最强信号。7月21日3.6 Flash与3.5 Flash-Lite,8月13日3.7 Flash,9月2日3.8 Flash——按Google自己的表述,这是“六周内第三次Flash发布”,节奏接近三周一更。
同日发布的还有Gemini 3.8 Flash Cyber,一款网络安全专用模型,只通过新的Fairwind Program向受信任的防守方开放。官方给出的战果颇为具体:Chrome安全团队称它产出的正确补丁是最优商用模型的2.6倍;Wiz称在其内部渗透测试基准上召回率提升7.5%—9.7%,成本低2.3至5.2倍;在Collinear运营的CWE-Bench补丁基准上pass@1为47.2%,与某领先前沿模型的47.8%只差0.6个百分点。
这里能读出的战略取向是:Google短期不在“最强模型”这个位置上硬拼,而是用Flash把“够用且能规模化部署”做到极致。爱范儿的信源称,在Gemini 3.5 Pro交付不顺后,Google把更多资源投向更快更便宜的Flash线;Google DeepMind负责人Demis Hassabis在访谈中承认当前模型“略低于前沿”,并说“我百分之百确定我们会回到前沿”(均为媒体转述,未见独立原文)。爱范儿还称Gemini App月活超10亿、自去年5月新增约6亿用户——增长并不依赖最强的那颗芯片。
但快节奏有副作用。开发者社区最常被拿来开涮的是模型下拉菜单改不过来的速度,更现实的困扰是版本稳定性:一个模型三个月后被下一代替代,企业很难把关键工作流押在“限时优惠价+三周一换”的产品线上。这也是官方强调“3.7 Flash仍被完全支持”的现实含义。
接下来该看什么
3.8 Flash是真进步,还是榜单上的进步,接下来有五个可验证的信号。
第一,DeepSWE榜单的置信区间会不会收窄。74%(±1%)对74%(±4%)本质是打平,Gemini的方差更小,Opus 5复测波动可能改变排序;同时要注意,Google官方博客的口径是“仅差Opus 5三个百分点”,媒体转读其图表为71.0%对74.0%,与第三方榜单存在差值,两个数字都不能当成唯一答案。
第二,降推理档位后的成本—质量曲线。如果medium档位能守住七成以上分数、单任务成本压到1美元级,它对中小企业的吸引力会真正兑现;反之,“便宜”只在高分档位成立。
第三,优惠期结束时的价格选择。2027年1月1日前后是否如期恢复1.5/7.5美元,会不会延长或改为分层定价,直接决定当前迁移窗口的性价比。
第四,Anthropic与OpenAI的反应。Opus 5发布于7月24日,官方称其以一半价格逼近Claude Fable 5的前沿能力;若对手两周内降价或提高推理效率,Flash这条线的性价比会被重新定义。
第五,实测样本会不会系统性变差。目前“跑分高、体感弱”的判断主要来自少数媒体单轮测试与开发者零散反馈,缺乏可复现的统一实测。
六周三款Flash,第三方榜单分数从47%追到74%,单价压到旗舰零头——Google把工程效率做到了极致。但“追平旗舰”和“用起来像旗舰”之间,还隔着一整套评测框架、一轮又一轮试错,以及那个尚未到期的限时价格。这代Flash真正的成绩单,可能要到2027年1月1日那天才开始写。
参考数据来源
- Google官方博客 · 《Introducing Gemini 3.8 Flash and 3.8 Flash Cyber》 · 2026年9月2日 · https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
- Datacurve · DeepSWE v1.1 长程软件工程基准榜单(113项任务,更新至2026年9月2日) · 2026年9月2日 · https://deepswe.datacurve.ai/
- 爱范儿 · 《Gemini 3.8 Flash 光速发布:干活挺勤快,就是没开窍》 · 2026年9月3日 · https://www.ifanr.com/1678197


