谷歌「史上最差」AI模型发布! Gemini 3.5 Pro延期
谁也没想到,谷歌的一次模型更新,会引发如此激烈的负面评价。
“从未见过如此糟糕的模型!”——这句话,成了谷歌Gemini 3.6 Flash发布后最真实的写照。
就在昨夜,谷歌DeepMind低调发布了三款新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。但期待中的Gemini 3.5 Pro正式版,却再次缺席。


在Vertex AI上线后,Gemini 3.6 Flash的口碑迅速遭遇滑铁卢。早期实测结果显示,这款模型在前端界面生成和空间推理方面的表现,差到让用户直呼“史上最差”。

当然,也不是完全没有好消息。Gemini 3.6 Flash在性能上确实比Gemini 3.1 Pro和Gemini 3.1 Pro更强,主打的定位是“性价比”。

但网友们更关心的是:“我那么大一个Gemini 3.5 Pro呢?”

先来看看被吐槽最狠的前端生成能力。在前端代码竞技场中,Gemini 3.6 Flash甚至不敌Claude Fable 5、GPT-5.6 Sol等当红模型,连Meta的Muse Spark 1.1都比不过。有开发者用2-shot测试它的界面生成能力——这本是Flash系列最擅长的场景之一。结果呢?直接懵了。

输出的界面代码逻辑错乱,组件嵌套混乱,交互逻辑断裂,完全无法投入实际使用。一位开发者直接给出了结论:“这是我真正见过的最差结果。”

这句话配上截图,在开发者社区迅速传播。
再来看空间推理。有用户专门录制了视频,逐帧测试Gemini 3.6 Flash在空间关系理解上的表现。结果同样令人失望:模型频繁出错,对基础的位置关系、方向判断的准确率,相比3.5 Flash明显退步。这位用户也只能自我安慰,可能没有开启高性能模型“high thinking”。遗憾的是,即便开启,效果也并不理想。另一位网友使用高推理强度后,第一印象依然不佳——木纹纹理看起来还行,没什么特别之处;大理石近距离看反射效果还不错,但存在bug。第二印象甚至更差。

在CursorBench上,Gemini 3.6 Flash的表现还不如Cursor的Composer 2.5。

谷歌自己发布的测试结果也显示,Gemini 3.6 Flash在代码任务上被其他模型超越,仅在视觉和上下文基准测试中保持了领先。

在第三方综合测评Artificial Analysis上,Gemini 3.6 Flash的得分与3.5 Flash完全相同,表现不如Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra……

更有网友发现,它的知识截止日期实际上并未更新到它所声称的时间。有用户直言:“这是一个未完成的模型。它声称是2026年3月,但实际上它对2026年甚至2025年的大部分内容一无所知。它的实际知识似乎停留在2025年1月。”

与此同时,Gemini 3.5 Flash-Lite主打速度快,每秒可输出350个token。速度确实快了,但“快速给出一个错误答案,等于用更高的效率浪费用户的时间”。更何况,对比竞争对手,它价格更贵,效果更差。

此外,谷歌这次还发布了网络安全模型Gemini 3.5 Flash Cyber。
面对这种局面,有用户讽刺称,DeepMind这种浪费算力的行为,还不如直接将资源转让给Moonshot等竞争对手。这番言论背后,是开发者对谷歌“版本号游戏”的深层厌恶。

谷歌似乎陷入了一种“官僚主义的指标狂热”:为了在财报和发布会上展示更高的版本号、更快的推理速度,牺牲了AI最本质的东西——真实效用。在3.6 Flash的发布公告中,谷歌提到,Gemini 3.5 Pro还没有完全准备好,而Gemini 4已开始“目前最雄心勃勃的预训练”,并“对取得的进展感到非常振奋”。

推测来看,近期3.5 Pro的开发进展并不理想,因此他们启动了全新的预训练课程。据CNBC报道,这是谷歌“有史以来规模最大的预训练项目”。


这次谷歌步子迈大了。

这种赶鸭子上架、败坏口碑的做法,到底图什么?

谷歌还能在AGI竞赛中有一席之地吗?
-
- 网名带郑和霍字的网名女有哪些
- 角色扮演 | 1
- 网名