Google 连发三个新 Gemini 模型,官方宣传与网友差评落差大,Gemini 4 能救场吗?
主角登场:3.6 Flash 到底强在哪
如果你从去年就开始用 Gemini,会感觉像看着自家兄弟得阿尔茨海默症,这是网友调侃。Google 发三个新模型后,网友反应更大。三个模型是 3.6 Flash、3.5 Flash - Lite、3.5 Flash Cyber,官方措辞熟悉,但实际体验不同。先说 3.6 Flash,官方定位是“主力”干活模型。3.5 Flash 今年 5 月发布,此次小迭代,卖点是省 token。按数据,3.6 Flash 比 3.5 Flash 少用 17%输出 token,特定场景省 65%。跑多步任务时推理步数和工具调用少。价格下降,输入 1.5 美元/百万 token,输出 7.5 美元/百万 token,上一代输出是 9 美元。基准测试中,代码能力提升,DeepSWE 从 37%到 49%,MLE Bench 从 49.7%到 63.9%,计算机操作能力 OSWorld - Verified 从 78.4%到 83%,“计算机操作”成内置工具。知识工作方面,GDPval - AA v2 从 1349 到 1421,客户反馈多模态任务表现好,有企业背书。知识截止日期从 2025 年 1 月到 2026 年 3 月,安全上有升级版防护。
以小博大:便宜大碗的 3.5 Flash - Lite 也能更换推理档位了
3.5 Flash - Lite 定位低于 3.6 Flash,主打“快”和“便宜”,适合高吞吐、低延迟任务。它是 3.5 系列最快的,每秒吐 350 个 token,价格便宜。质量比 3 月的 3.1 Flash - Lite 好。支持调“推理档位”,电脑操作成内置工具。跟前代比提升明显,在不少任务上反超 3 Flash,官方举例多种用法,有客户夸赞。
3.5 Flash Cyber:专门修补代码安全漏洞
3.5 Flash Cyber 专门找和修代码安全漏洞。因 AI 找漏洞快,Google 用 Flash 补漏洞。它在 3.5 Flash 基础微调,搭配 CodeMender 工具,在业内基准上达第一梯队且省 token。只对“可信合作伙伴”限量内测,防漏洞被利用。
说好的 3.5 Pro 呢?
官方称 3.5 Pro 正和合作伙伴测试。但据报道,其代码生成能力未达预期,更新数据后仍无起色,甚至可能重训。宣传委员跳过 3.5 Pro 预告 Gemini 4,有转移视线之嫌。
网友并不买账
第三方评测机构称新模型有提升,但 3.6 Flash 智能水平基本原地踏步,价格和能力不匹配。网友吐槽 3.6 Flash 不如对手,性价比低。OpenAI 因用户达 1000 万给付费用户重置额度。实测网友指出新模型性能差,有诸多问题。一边是官方宣传,一边是网友差评,让人怀疑 Google 是否点歪科技树,Gemini 4 若再翻车,调侃或成真。
