基準測試高分,實戰卻打折扣

Gemini 4 Agron 在業界常用基準測試中成績優異,但直接參與開發的員工指出,實際工作時表現打折,程式設計能力未達預期,尤其前端設計(決定 App 與網站外觀及操作體驗)是弱項。部分員工認為 Anthropic Fable 與 OpenAI Astra 進步更快,即使 Gemini 4 發揮最佳水準,某些領域仍落後;但也有員工認為新模型已追上業界頂尖水準。

Google 否認說法,強調「高度共識」

Google 否認程式設計表現不佳的說法,稱公司有「高度共識」認為 Gemini 4 位居尖端,且經過嚴格測試。DeepMind 負責人 Koray Kavukcuoglu 表示完全信任團隊,認為 Google 必定會一直站在前線。然而,業界批評此為「刷榜」(benchmaxxing),即優先追求標準化測試高分,而非打造真正實用的產品。AI 新創 Surge AI 創辦人 Edwin Chen 比喻,孩子 SAT 考高分,不代表出社會後表現也很好。

多模態與資安有亮點,成本壓力待解

Gemini 4 並非沒有亮點,多模態應用如從影片擷取中繼資料表現出色,資安領域也具競爭力,Google 稱某資安基準測試勝過 Astra,並率先開放特定資安合作夥伴。但 Gemini 4 屬大型模型,推論成本較高,恐對利潤率造成壓力。Gemini 4 推出歷經波折,Google 原計畫年 6 月推出 Gemini 3.5 Pro,最終未達目標而放棄。頂尖模型單次訓練成本最高可達 4 億美元,實用性將左右 Google 競爭地位。