Gemini 3.6 Flash发布却遭群嘲?谷歌大模型性价比背后的尴尬

type
status
date
slug
summary
tags
category
icon
password
网址
在人工智能领域的激烈竞争中,谷歌(Google)的一举一动都备受瞩目。然而,最近谷歌的发布会却陷入了一种尴尬的境地。就在刚刚,谷歌一口气发布了三个全新的轻量化模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 以及专为网络安全设计的 Gemini 3.5 Flash Cyber。
尽管官方博客使用了“更高效”、“更聪明”、“为大规模 AI Agent 而生”等一贯的高调措辞,但社交媒体上的反馈却是一片群嘲。有网友甚至调侃道,使用 Gemini 的过程就像是看着自家兄弟一步步走向记忆衰退。为什么谷歌的新模型发布没有迎来掌声,反而让网友笑得更大声了?本文将为您深入解读这次发布背后的技术细节与行业困局。

降本增效的“主力军”:Gemini 3.6 Flash 到底更新了什么

作为本次发布的核心,Gemini 3.6 Flash 被谷歌定位为干活的“主力模型”(Workhorse)。相比于今年5月发布的 3.5 版本,3.6 Flash 带来了一些针对开发者痛点的优化,其中最显著的提升在于 Token 的使用效率和价格的降低。
根据第三方评测机构的数据,Gemini 3.6 Flash 在输出时比前代节省了约 17% 的 Token,在特定的基准测试(如 DeepSWE)中甚至能节省高达 65% 的 Token。这意味着在执行多步骤的复杂任务时,模型能够用更少的废话和更直接的推理路径完成任务,从而直接降低了开发者的调用账单。
在价格方面,谷歌将输入费用定为 1.5 美元/百万 Token,输出费用从上一代的 9 美元降至 7.5 美元/百万 Token。这对于需要大规模部署 AI Agent 的企业来说,确实是一个实实在在的降本信号。
在性能基准上,谷歌也给出了一份不错的成绩单: * 代码能力:在 DeepSWE 基准上从 37% 提升至 49%,MLE Bench(机器学习研究方向)从 49.7% 提升至 63.9%,生成的代码更贴近实际生产环境。 * 计算机操作(Computer Use):OSWorld 验证集得分从 78.4% 升至 83%,且该功能已成为 API 和企业版的内置工具。 * 知识时效:知识截止日期终于从 2025 年 1 月更新到了 2026 年 3 月。

便宜大碗的“小弟”:3.5 Flash-Lite 的以小博大

除了主力模型,谷歌还推出了定位更低的 Gemini 3.5 Flash-Lite。这个模型主打“极速”与“极致性价比”,专为高吞吐量、低延迟的任务(如实时搜索、文档预处理)而设计。
在测试中,3.5 Flash-Lite 的生成速度达到了每秒 350 个 Token。而其价格更是低廉:输入 0.3 美元/百万 Token,输出 2.5 美元/百万 Token。
值得注意的是,3.5 Flash-Lite 引入了“可调推理档位”的设计。开发者可以根据任务的复杂程度,在低配快速响应和高配多步拆解之间自由切换。在实际测试中,这个“小弟”在 SWE-Bench Pro 和 OSWorld 等 Agent 任务上的表现,甚至反超了辈分更高的 Gemini 3 Flash,成为了性价比极高的平替选择。
此外,谷歌还发布了微调版模型 Gemini 3.5 Flash Cyber,专门用于自动寻找和修补代码中的安全漏洞。不过,由于安全敏感性,该模型目前仅对可信合作伙伴限量开放。

理想与现实的落差:网友群嘲与旗舰 Pro 跳票的内幕

既然新模型又快又省,为什么网友不买账?
首先是“智商”的原地踏步。第三方评测机构指出,尽管 Gemini 3.6 Flash 在效率和速度上有所提升,但其核心的智能水平与 3.5 Flash 相比几乎没有实质性增长。在面对竞争对手的同类轻量级模型时,其性价比优势并不明显,甚至被指责“又贵又笨”。
其次,实测用户的反馈给谷歌泼了一盆冷水。有开发者在社交平台上吐槽,新模型在基础解码、中文选词上经常出现离谱错误,多模态生成的质量不尽如人意,甚至在调用工具时频繁出现记忆混乱。
更致命的是旗舰模型 Gemini 3.5 Pro 的“难产”。据行业媒体报道,3.5 Pro 的代码生成能力一直未能达到谷歌内部的预期标准,即使在去年底更新了训练数据后依然没有起色,甚至传出了推倒重训的消息。面对旗舰模型的跳票,谷歌宣传人员不得不将舆论焦点转向正在预训练的 Gemini 4,这种“画饼”行为无疑加剧了外界的质疑。

大模型下半场:性价比与智力极限的博弈

谷歌这次的更新,折射出大模型厂商在商业化落地上面临的共同难题:如何在降低算力成本的同时,维持模型的智能水平?谷歌显然把技能点偏向了“省钱”和“提速”,但在决定大模型上限的“智力”维度上,却显得有些力不从心。如果接下来的旗舰模型或 Gemini 4 无法带来突破性的技术飞跃,谷歌在与 OpenAI、Anthropic 等对手的竞争中可能会面临更大的压力。
对于开发者和AI爱好者来说,紧跟行业前沿动态、选择最适合自己业务场景的大模型至关重要。如果你想获取最新的 AI资讯、大模型 技术评测以及实用的 Prompt 提示词技巧,欢迎访问专业的 AI门户 https://aigc.bar。在这里,我们为您提供一手的 人工智能 行业日报与深度解析,帮助您在 AGI 时代把握先机,实现 AI变现 与技术沉淀。
Loading...

没有找到文章