掃呢頁CODE去手機

2026年7月23日 星期四

Google 模型已跌出前十名 Gemini 3.6 Flash 評測出爐 智能零提升 #Google

Google 模型已跌出前十名 Gemini 3.6 Flash 評測出爐 智能零提升
GoogleDeepMind於當地時間7月21日推出三款輕量級新模型,主打「更快、更智能、更具成本效益」,但模型實際的智能表現未達外界預期,評價兩極。 ...




Google DeepMind 於當地時間 7 月 21 日推出三款輕量級新模型,主打「更快、更智能、更具成本效益」,但模型實際的智能表現未達外界預期,評價兩極。與此同時,外界最期待的旗艦級模型 Gemini 3.5 Pro 依然未有公開亮相,成為焦點。根據多個排行榜顯示,Google 模型已跌出前十名。

三款新模型定位各異

Google 官方部落格公布,新推出的 Gemini 3.6 Flash 為主力模型,比上一代使用更少 token,在相同成本下提供更高品質的輸出;Gemini 3.5 Flash-Lite 主打快速、高成本效益,適合處理文件及搜尋等日常工作;而 Gemini 3.5 Flash Cyber 則專為發現及修補關鍵軟件漏洞而設計,屬網絡安全模型。

不過評測結果顯示,新模型的智能表現並不突出。AI 模型評測平台 Arena.ai 的研究顯示,Gemini 3.6 Flash 在前端程式碼競技場中以 1,537 分排名第 12 位。第三方評測機構 Artificial Analysis 亦指出,Gemini 3.6 Flash 在智能指數上得 50 分,與上一代 Gemini 3.5 Flash 完全一致,未見提升,但每項任務平均耗時 1.3 分鐘,較上一代減少超過 50%,同時每項任務成本亦略為降低。換句話說,Google 這次最佳化的重點在於速度及成本,而非模型能力本身。

排行榜跌出十大 開發者評價兩極

Artificial Analysis 最新智能指數排行榜顯示,Google 目前已無任何一款模型進入前十名,排名靠前的主要是 Anthropic、OpenAI 等海外廠商,同時亦包括內地月之暗面的 Kimi K3 及智譜 GLM-5.2。這與去年 Gemini 一度站上全球第一梯隊的情況形成明顯反差。多個獨立排行榜均顯示,Anthropic 的 Claude Fable 5 現時穩坐榜首。

開發者社群的反應同樣分化。有人形容新模型「前端能力糟糕、空間推理也很差」;亦有人批評 Google 像龜兔賽跑中的兔子,「領先一段時間後就開始睡覺」;更有人直言 Gemini 團隊需要引入真正關心交付前沿模型的人才。

Gemini 3.5 Pro 一再延後

相比 Flash 系列模型,外界更關注旗艦模型 Gemini 3.5 Pro 何時推出。Google 於 5 月 I/O 大會發布 Gemini 3.5 Flash 時曾預告 Pro 版本已在內部使用,預期一個月內推出,但兩個月過去,至今仍未公開亮相。據外媒報道,由於模型表現一直未達內部預期,Google 決定推遲發布計劃。

Google DeepMind 技術負責人 Logan Kilpatrick 在社交媒體回應指,Gemini 3.5 Pro 正與合作夥伴進行測試,計劃準備就緒後即廣泛提供,但未有透露具體時間表。同時 Google 在部落格中透露,團隊已啟動「迄今為止規模最大」的 Gemini 4 預訓練工作,並對目前進展感到振奮,令業界猜測資源會否轉向下一代模型,而非繼續打磨 3.5 Pro。

策略路線惹爭議

有分析認為,Google 目前表現未必是能力不足,而是內部策略方向的問題——優先放在產品落地及應用,而非像 Anthropic、OpenAI 等廠商專注打磨模型本身。有開發者批評,Google 這次策略似乎是「速度勝過智慧」,任務時間縮短固然好,但智能停滯代表優先考慮了錯誤的指標,直言「創新也需要深度,而不僅是秒錶」。不過亦有開發者從商業角度理解,認為 Google 將模型「降智」以節省成本屬聰明做法,畢竟新興公司普遍靠燒錢營運,一旦資金耗盡便面臨倒閉風險。

回顧 2025 年 11 月,Google 發布 Gemini 3 模型時曾引發業界震動,一度反超 OpenAI,站穩第一梯隊,股價隨即飆升。踏入 2026 年,AI 競爭風向再度轉變,OpenAI 依靠持續推出新模型重奪行業關注度,Anthropic 依然保持模型能力的領先位置,而 Google 展現更多的是成本最佳化及產品整合能力。



資料來源:cnBeta






本文作轉載及備份之用 來源 source: http://unwire.hk
鍾意就快D Share啦!