Google發表Gemini 4 Argon 主打軟體開發與企業任務、部分評測居冠

Google發表Gemini 4 Argon 主打軟體開發與企業任務、部分評測居冠

有助於理解文章的圖片

Google揭曉新一代AI模型

Google於2026年9月30日(當地時間)發表新人工智慧模型「Gemini 4 Argon」,宣稱可在實際軟體工程、法律與金融等企業知識工作,以及網路安全防禦等複雜任務上提供頂尖效能。相關公告由Google DeepMind資深副總裁暨Google首席AI架構師科雷・卡布克丘奧盧署名發布。

軟體、影像與法律評測取得高分

依Google公布的數據,Gemini 4 Argon在軟體工程評測DeepSWE v1.1獲得77.9%,高於VentureBeat列出的Claude Opus 5.5的74.2%及GPT-6 Astra的74.1%。在衡量工作自動化能力的AutomationBench中,Argon也以51.3%排名第一。

影像評測方面,Google表示Argon在LVBench取得91.7%,VentureBeat列出的GPT-6 Astra與Claude Opus 5.5則分別為87.5%及83.7%。Harvey的Legal Agent法律代理評測中,Argon獲得19.6%,同樣高於GPT-6 Astra的5.4%與Claude Opus 5.5的3.8%。

部分開發任務仍落後競爭對手

Argon並未在所有開發相關評測中領先。VentureBeat公布的FrontierSWE v2結果顯示,GPT-6 Astra以65.5%超過Argon的55.0%;Terminal-Bench Science 0.1中,GPT-6 Astra獲得68.1%,Argon則為57.6%。在Terminal-bench 4.0,Claude Opus 5.5以66.4%領先Argon的57.4%。

網路安全評測CWE-bench v1方面,Google公布Argon與3.8 Flash Cyber均取得68%,並列第一。Google表示,未套用網路安全防護限制的Argon版本,預計提供給可信賴的防禦組織及公司內部團隊使用。

獨立評估排名第一 代理任務表現有落差

獨立評估機構Vals AI統計,Gemini 4 Argon在Vals Index獲得68.90%,於41款模型中排名第一,每次測試成本為15.68美元。Claude Sonnet 5.5以67.04%居後,每次測試成本21.34美元;Claude Opus 5.5為66.97%、32.14美元,Claude Fable 5.1則為65.83%。Argon的準確度標示為68.90% ± 0.97,延遲時間為46分33秒。

在Vals AI其他評測中,Argon於IOI基準測試取得100.00%,與GPT-6 Astra並列;Vibe Code Bench及Code Migration則排名第二。Arena文字排行榜將Argon列為第一名並給予「High」等級,但在Top 10 Agents的Best Overall項目中,Argon僅以7.92%排名第八;Pareto Optimal Models項目則記載其每項任務成本為0.62美元、效能為7.92%。

輸出上限與價格資訊出現差異

Google表示,Argon的輸出詞元上限已從64K擴大至100萬。不過,Vals AI資料將其上下文視窗列為100萬詞元,最大輸出則為26.2萬詞元,與Google公布的輸出上限不同。Vals AI標示的標準價格為每100萬輸入詞元4美元、每100萬輸出詞元20美元。

Google公布的上市初期價格較低,每100萬輸入詞元2美元、每100萬輸出詞元10美元,快取輸入詞元可享輸入價格95%折扣。優惠期結束後,價格將調整為輸入4美元、輸出20美元。VentureBeat分析,Argon初期價格約為GPT-6 Astra標示API價格的五分之一。

初期僅向特定組織開放

Gemini 4 Argon目前透過Fairwind Program,分階段提供給部分可信賴的網路安全防禦組織,尚未全面開放。Google計畫先從付費API客戶與Google AI Ultra訂閱用戶開始,再逐步擴大至開發者、企業及一般消費者;VentureBeat指出,多數客戶仍須等待更廣泛的API存取權限開放。

Source: Original Korean article - Trendy News Korea

留言