OpenAI發表GPT-6 Sol、Luna並調降API價格 主打程式開發與辦公任務

OpenAI發表GPT-6 Sol、Luna並調降API價格 主打程式開發與辦公任務

有助於理解文章的圖片

兩款新模型鎖定不同工作場景

OpenAI於2026年9月22日(當地時間)發表GPT-6 Sol與GPT-6 Luna。公司表示,兩款模型採用與GPT-6 Astra相近的訓練方式,將專業工作、事實準確度、程式開發、電腦操作及模型對齊等方面的改進,移轉至速度更快、成本更低的模型。

GPT-6 Sol主要鎖定複雜程式開發任務;GPT-6 Luna則著重辦公作業、摘要與資訊擷取。兩款模型的API識別碼分別為「gpt-6-sol」與「gpt-6-luna」,自發表當日起開放使用。

API費率下調 ChatGPT與Codex同步導入

GPT-6 Sol的API價格為每100萬個輸入權杖2美元、每100萬個輸出權杖10美元。OpenAI稱,這項定價較GPT-5.6的促銷價格低50%。GPT-6 Luna每100萬個輸入權杖的價格則由0.20美元降至0.10美元,輸出價格由1.20美元降至0.50美元。

Plus、Pro、Business、Enterprise及Edu方案用戶,可自發表日起透過ChatGPT Work與Codex使用兩款模型;Free與Go用戶則可在桌面版應用程式使用GPT-6 Luna。不過,MacRumors報導,兩款模型推出時尚未開放於Chat模式使用。

GitHub也將陸續把新模型導入VS Code、Visual Studio、Copilot CLI、雲端代理工具、Copilot應用程式、GitHub網站與行動版,以及JetBrains、Xcode和Eclipse中的GitHub Copilot。Sol供Copilot Pro+、Max、Business及Enterprise方案使用;Luna則涵蓋Pro、Pro+、Max、Business與Enterprise方案。

OpenAI強調成本效益 評測限制仍須留意

依OpenAI公布的數據,GPT-6 Sol在AutomationBench採用xhigh effort設定時,以每項任務0.27美元的成本取得33.2%;在Agents' Last Exam的max effort設定下獲得56.4%。DeepSWE v1.1的max effort成績則為Sol 68.8%、Luna 66.6%。同一項評測中,Claude Fable 5在xhigh effort設定下取得69.9%,高於GPT-6 Sol。

在OSWorld 2.0離線測試中,採xhigh effort設定的GPT-6 Sol得分60.5%,Claude Opus 5在medium effort設定下為60.3%。OpenAI表示,Sol在每項任務成本約低80%的情況下,取得與Claude Opus 5相近的成績。公司也稱,使用max設定的GPT-6 Luna,能以十分之一的成本超越medium設定的GPT-5.6 Sol。

OpenAI表示,在使用去識別化真實對話進行的內部事實性評估中,Sol的錯誤約為GPT-5.6 Sol的一半,但發表資料未納入第三方驗證結果。公司同時說明,這些對話是特別挑選的易出錯案例,不能代表事實錯誤較少的一般使用情境;代理與程式開發評測也刻意測試困難狀況,並非用來衡量日常使用的失敗率。

獨立評測結果有升有降

獨立評測機構Artificial Analysis的Coding Agent Index顯示,max設定的GPT-6 Sol由前代55分升至57分,但GPT-6 Luna則由43分降至41分。AA-Omniscience Index方面,Sol由22分升至27分,Luna由負10分升至1分;該指數測得的幻覺率,Sol由92%降至60%,Luna由93%降至77%。

Terminal-Bench 4.0中,Sol由40%升至44%,Luna由12%升至13%;AutomationBench-AA也分別由60%升至62%、50%升至53%。不過,GDPval-AA v2.1的Sol約下滑100 Elo,Luna約下滑75 Elo;AA-Briefcase v1.1中,Luna約下降45 Elo,Sol則維持相同水準。

Artificial Analysis認為,GDPval-AA與AA-Briefcase成績下滑,並非基礎能力退步,而是輸出內容的表達品質下降,且未涵蓋部分評分標準要求的要素。該機構統計顯示,max設定下的每項任務成本,Sol降至1.06美元、約減少一半,Luna降至0.07美元、約減少60%;但綜合Intelligence Index僅Sol增加1分,Luna沒有變化。

Anthropic同日推出競爭模型

Anthropic在OpenAI發表GPT-6 Sol與Luna約90分鐘前,推出Claude Opus 5.5。MacRumors指出,這款同日問世的模型在部分程式開發與知識工作上優於GPT-6 Astra,也讓不同模型之間的單項任務成本更難直接比較。

整體而言,公開結果顯示GPT-6 Sol在部分獨立程式開發指標上較前代進步,兩款模型的使用成本也明顯下降;但GPT-6 Luna的Coding Agent Index退步,兩款模型在GDPval-AA的表現亦同步下滑。OpenAI自家公布的DeepSWE v1.1結果中,GPT-6 Sol也仍低於Claude Fable 5的最高成績。

Source: Original Korean article - Trendy News Korea

留言