科技

Gemini三款新模型仅面向特定群体开放 安全属性亮眼却难掩大众感知缺失

来源:快线潮资讯
Gemini三款新模型仅面向特定群体开放 安全属性亮眼却难掩大众感知缺失

7 月 21 日,谷歌憋着的大模型总算发布了。

既没开发布会,也没搞直播,官方只默默发了条推文,上了一个网页页面就算完事。

这种敷衍感难免,毕竟大家盼着的旗舰 Gemini 3.5 Pro 没影,反倒放出了 3 款轻量模型:3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber。

不是吧,明明 5 月 I/O 大会上亲口承诺 6 月上 Pro 模型,现在都 7 月底了还没动静,这招“大记忆消失术”玩得溜啊!

事已至此,不妨来看看这三款模型的实际表现如何。

先说说这次主推的 3.6 Flash,谷歌宣传的核心点在于同成本下效果更强。

官方数据显示,3.6 Flash 的输出 Token 消耗比上一代降低了 18%。虽说提升不算特别大,但这意味着干活更利索了,至少没那么啰嗦,能走最快路径完成任务,省下的就是赚到的。

输出单价跟着降了,从 9 美元直接砍到 7.5 美元/百万 Token,主打一个省钱。

代码基准测试方面,DeepSWE 从 37% 涨到了 49%。毕竟代码生成需求激增,这种能力提升紧跟生产场景,优化重点自然也是它。

纸面数据看着是一次均衡升级,实测结果却不对劲。

根据 Artificial Analysis 的测试,3.6 Flash 的综合智能评分和上代 3.5 Flash 完全持平。本质上它只优化了推理链路,底层理解能力没变,虽然算力成本降了,但解决复杂问题的上限依然没涨。

翻译翻译就是,变便宜了,智力却没涨……

X 平台上也有用户分享了不同场景下的实际表现,只能说一言难尽……

说白了,这次 Gemini 升级优化的不是智商,是效率。它学会了少说废话、少走弯路,干同样的简单活儿,算力消耗更少,更省钱。

但要是指望它搞定复杂任务,比如长链条代码重构、多模态创作、深度逻辑推演,抱歉,依然拉胯。

不谈智能光谈省钱,这妥妥就是个伪命题……

省 Token 确实省,笨也是真笨。简单批量任务用着划算,一碰复杂逻辑就得反复提示、多轮修正,看着单次便宜,总调用成本反而更高,离了大谱!

另一款 3.5 Flash-Lite,定位更极致:便宜、快、吞吐量大。

价格不用问,量大管饱,输入 0.3 美元、输出 2.5 美元/百万 Token,算是直接干到了地板价。

代价很明显,模型能力被大幅裁剪,上下文深度、逻辑复杂度都砍了一刀,更适合干批量摘要、简单检索这种流水线粗活。

不过,总算比 3.1 Flash-Lite 聪明点。

说实话,我觉得这就是专门给海量标准化任务准备的“算力耗材”,跟智能基本不沾边。

至于 3.5 Flash Cyber,这玩意儿跟普通用户没啥关系。

它是为代码漏洞扫描微调的,仅对政府、可信企业内测开放。料想谷歌在 AI 安全防范这套叙事上挺严谨,生怕被用来挖掘攻击漏洞,所以严格锁死了准入门槛。

看下来,3.5 Flash Cyber 更像是补足安全赛道的点缀产品,谈不上核心竞争力,也撑不起大众口碑。

至于表现如何?普通用户测不到,在知名的 CyberGym 基准上,官方表示属于具有竞争力的水平,咱就当看个热闹。

所以,说了这么多,大家最关心的问题是:还能等到 Gemini 3.5 Pro 吗?

据彭博社等科技媒体报道,3.5 Pro 缺陷的原因大概率在于代码生成与智能体规划能力不达标。

在企业付费场景里,代码和自主 Agent 是高商业价值赛道,客户愿意为能独立完成工程重构、自动化运维的模型支付高额服务费。

据说,谷歌多轮内部测试显示,3.5 Pro 在代码基准、长程工具调用上始终达不到及格线。即便迭代多版训练数据集,提升幅度依旧远低于预期,最终只能跳票。

这么看,谷歌处境挺棘手,高端客户在流失,自家旗舰又交不出货,除了拿低价 Flash 模型守着中低端盘子,好像也没别的办法。

谷歌这边,没准是因为舆论都在抱怨旗舰跳票,官方就顺势放了个消息:Gemini 4 已启动史上最大规模预训练。

这……谷歌你这浓眉大眼的,怎么也学会画饼了!

现在的产品拿不出手,就用下一代的远期预期安抚资本市场和用户。

这种操作硅谷大厂玩得轻车熟路,但远水救不了近火,用多了只会越来越消耗大家的信任。

按道理说,谷歌做 AI 大模型,不应该拉垮。

它是 Transformer 的诞生地,深度学习时代的王者,DeepMind 做出过 AlphaGo 这种惊艳全世界的成果。

没人会怀疑谷歌的技术底蕴,可一手好牌打成今天这样,旗舰跳票、人才流失、市场份额被蚕食,确实让人唏嘘。

此前,网上流传 Anthropic 创始人说 Kimi 蒸馏了他们尚未开发完成的模型,成了大家的笑谈。

实在不行,不如让 Gemini 直接蒸馏 Kimi K3,起码模型表现能好点。

毕竟 AI 时代,没有永远的王者,菜就是原罪。

深耕十余年的科技媒体,近千万读者的兴趣栖息地,每日跟踪科技、数码、AI、新能源、热点等重磅内容,专注于每日为大家提供更新鲜、前沿、专业、发展的热点科技报道,欢迎关注@科技狐!

相关推荐

最新文章