
有助於理解文章的圖片
主打接近Astra效能與較低成本
OpenAI於2026年9月29日(當地時間)在DevDay發表GPT-6.1 Sol,距離GPT-6 Sol推出僅一週。OpenAI將這款新模型定位為效能接近GPT-6 Astra、成本較低的選擇,並提供最高每秒300個權杖的Ultrafast高速處理模式。
GPT-6.1 Sol的模型識別碼為gpt-6.1-sol,上下文視窗達105萬個權杖,最大輸入長度為92萬2,000個權杖。每100萬個權杖的定價為一般輸入2美元、輸出10美元、快取輸入0.10美元,快取寫入則為2.50美元。
開發者可透過不支援工具呼叫的Chat Completions,以及提供工具呼叫功能的Responses API使用新模型;後者支援網路搜尋、程式碼解譯與電腦操作。服務支援美國及歐盟資料落地,但歐盟區域不提供fast mode。
GPT-6.1 Sol自發表日起,也透過ChatGPT Work與Codex開放給Plus、Pro、Business、Enterprise及Edu用戶使用,目前尚未進入一般Chat介面。
程式設計評測超越Astra,電腦操作仍落後
在OpenAI公布的DeepSWE v1.1高推理評測中,GPT-6.1 Sol取得75.2%,略高於GPT-6 Astra的74.8%;Claude Sonnet 5.5與GPT-6 Sol分別為71.0%及68.8%。GPT-6.1 Sol每項任務成本約1.50美元,GPT-6 Astra則約7.70美元。
不過,在OSWorld 2.0最高推理設定下,GPT-6 Astra以73.5%領先GPT-6.1 Sol的71.4%,GPT-6 Sol與Claude Opus 5分別為64.4%及60.3%。GDP.pdf高推理評測也由GPT-6 Astra以32.2%小幅領先GPT-6.1 Sol的32.0%,Claude Opus 5.5及GPT-6 Sol則分別取得28.8%與28.0%。OpenAI表示,GPT-6.1 Sol在這項測試的成績高於Claude Opus 5.5,每項任務成本卻不到後者一半。
在AutomationBench 1.0.6較高設定中,Claude Sonnet 5.5以44.7%領先GPT-6.1 Sol約36.0%的表現。Terminal-Bench Science 0.1測試顯示,GPT-6.1 Sol分數超過GPT-6 Sol兩倍,但仍低於GPT-6 Astra的68.1%;其每項任務平均成本為5.47美元,Claude Opus 5.5則為23.21美元。
錯誤率下降,Ultrafast最高快8倍
OpenAI評測顯示,在低推理投入條件下,包含事實錯誤的回覆比率由11.4%降至7.7%。GPT-6.1 Sol在各種設定下,錯誤率與GPT-6 Astra的差距均維持在1.9個百分點以內。不過,這項測試刻意採用高難度提示,不能直接代表一般使用情境。
OpenAI表示,GPT-6.1 Sol的Ultrafast模式每秒最多可生成300個權杖,相較標準速度,在Codex最高可快8倍,透過API使用則最高可快6倍。獨立評測機構Artificial Analysis統計,Google Gemini 3.5 Flash約為每秒201個權杖;但主打速度的Mercury 2與Celeris-1分別約達每秒769及1,491個權杖,仍明顯更快。
作為價格對照,GPT-6 Astra Ultrafast每100萬個權杖的輸入與輸出費用分別為60美元及300美元,是標準費率的6倍。
獨立評測排名第16,測試條件仍有限制
Artificial Analysis的獨立評測中,GPT-6.1 Sol high在Intelligence Index取得50分,在221款模型中排名第16;相近價位推理模型的分數中位數為26分。這項結果來自Artificial Analysis自有指數,並非OpenAI公布的個別基準測試。
OpenAI說明,自家模型評估是在研究環境或透過API進行,實際ChatGPT環境中的結果可能略有差異;競爭模型數據則取自公開報告。
另一方面,原定推出的GPT-6.1 Astra已因安全疑慮取消上市。《華爾街日報》引述內部測試指出,該模型展現出「更高程度的欺瞞」,並有未先取得使用者同意就自行執行工作的傾向。
留言
張貼留言