Mistral AI發表兆級參數Mistral Large 4 主打程式開發、資安與知識工作

Mistral AI發表兆級參數Mistral Large 4 主打程式開發、資安與知識工作

有助於理解文章的圖片

兆級參數模型先開放API預覽

法國人工智慧新創Mistral AI於2026年10月6日發表新一代模型Mistral Large 4,別名「le Chonk」。模型採用專家混合架構,總參數規模達1兆個,每次運算啟用其中490億個參數,主要鎖定程式開發代理、知識工作、網路安全及視覺位置推理等應用。

Mistral Large 4的模型代號為mistral-large-4-0,目前可透過Mistral Studio使用預覽版API,每100萬個權杖的輸入與輸出價格分別為1.36美元及4.18美元。模型現階段僅透過公開預覽及設有安全防護機制的端點提供,權重尚未釋出。

Mistral AI預定10月27日公開模型權重,在此之前將進行約3週測試,並與可信賴的合作夥伴及政府合作完成安全性評估。公司表示,此舉是為了確保模型可用於防禦,但不被拿來從事惡意攻擊。模型採用客製化Mistral授權條款,支援超過160種語言及多模態輸入,但輸出僅限文字。

這款模型使用4,000顆輝達Grace Blackwell GPU訓練約兩個月。Mistral AI此前於9月完成30億歐元募資,當時公司估值達210億歐元。

程式開發表現亮眼 但未全面領先封閉模型

依Mistral AI公布的測試結果,Mistral Large 4在DeepSWE v1.1取得61.7%,高於DeepSeek V4 Pro 0813;Terminal Bench 4.0得分28.3%,超越Qwen3.8 Max;SWE-Atlas-QnA則為59.4%,高於公司追蹤的其他競爭模型。綜合Coding Agent Index得分為49.8%,同樣領先DeepSeek V4 Pro及Qwen3.8 Max。

不過,Surge AI進行的程式開發盲測人工評估中,Mistral Large 4獲得滿分5分中的3.74分,低於Claude Opus 5的4.22分。另一份DeepSWE v1.1統計顯示,Mistral Large 4得分62%,略高於GLM-5.3的61%,但GPT-6 Astra、Gemini 3.8 Flash及Claude Opus 5在公開最佳設定下均約為74%。

工作自動化方面,Mistral AI公布的AutomationBench成績為59.9%,領先Kimi K3、MiMo-V2.6-Pro及DeepSeek V4 Pro;衡量知識工作的AA-Briefcase Elo分數為1,393,也高於DeepSeek V4 Pro。Harvey Legal Agent測試中,Mistral Large 4取得15%,高於Kimi K3的12.92%及GLM-5.3的8.33%;Finch Finance則與DeepSeek V4 Pro 0813同為67%。

資安與視覺推理成為主要賣點

Mistral AI表示,Mistral Large 4在AA Cyber Index躋身全球前5名,Cybench整體得分達93%,高於主要開放權重模型。B3 Security Benchmark的攻擊抵抗能力為93.3%,KORA Benchmark責任回應評估則獲得滿分2分中的1.691分,優於GLM-5.2、GLM-5.3及Kimi系列模型。

在視覺位置推理測試Dense 200中,公司公布Mistral Large 4得分42%,略高於GPT-6 Astra的41%;DIOR-RSVG視覺評估則為73%。Mistral AI也稱,該模型在SciCode-Verified科學程式測試中達到開放權重模型領先水準。

Mistral AI執行長阿蒂爾.門施表示,新模型在網路安全等部分領域領先中國模型,但未說明比較對象及方法。

獨立評測呈現落差 強化學習仍在進行

獨立評測機構Vals AI的結果較為保守。Mistral Large 4在Vals Index取得48.05% ± 1.11,在44個模型中排名第32;Harvey Legal Agent為15.83% ± 2.96,在75個模型中排名第6。Finance Agent v2、Tax Agent Bench、EMB及Vibe Code Bench v1.1則分別排名第22、第25、第43及第25。

Artificial Analysis Intelligence Index給予Mistral Large 4總分38.4分,在開放權重模型中排名第8。其成績低於Xiaomi MiMo-V2.6-Pro的46.3分、Z.ai GLM-5.3的44.8分及Moonshot AI Kimi K3的43.6分,但高於DeepSeek V4 Pro的36分、GLM-5.2的33.7分,以及韓國Motif 3的33.6分。Motif 3此前是中國以外表現最強的開放權重模型。

相較之下,封閉型模型Claude Opus 5.5、GPT-6 Astra及Gemini 4 Argon分別取得57.6分、52.7分及52.6分,均高於Mistral Large 4。Artificial Analysis估算,Mistral Large 4每項工作的成本為1.13美元,約合1歐元。

Mistral AI指出,預覽版的強化學習仍在進行,模型尚未出現效能飽和跡象,因此仍有改善空間。公司科學事務副總裁皮耶.史托克表示,訓練所用運算量明顯少於封閉型競爭模型,也比中國競爭模型少約2至3倍。不過,部分基準測試及競爭模型的完整分數仍未公開。

Source: Original Korean article - Trendy News Korea

留言