
有助於理解文章的圖片
新模型跨雲端平台上線
人工智慧公司Anthropic於2026年9月28日(當地時間)發表Claude Sonnet 5.5,模型識別碼為claude-sonnet-5-5。公司將更高的基準測試成績與成本效益列為主要賣點,並表示新模型即使採用低度或中度推理設定,也能以更低的單項任務成本,超越前代Sonnet 5的最高成績。
Claude Sonnet 5.5可透過Claude Platform、AWS、Google Cloud及Microsoft Azure使用,並支援不保留資料的配置。API定價為每100萬個輸入權杖2美元、每100萬個輸出權杖10美元;快取讀取每100萬個權杖0.20美元,快取寫入則為2.50美元。
科技媒體VentureBeat指出,Sonnet 5.5定價與GPT-6 Sol相同,低於每100萬個輸入權杖4美元、輸出權杖20美元的Opus 5.5。Anthropic表示,Sonnet 5.5在低度或中度推理設定下,能以約十分之一的單項任務成本超越Sonnet 5最高分。SiliconANGLE則報導,新模型較前一代輸出速度提升30%,所需權杖數減少,實際成本也約降低30%。
部分測試超越前代,複雜任務仍由Opus領先
依Anthropic公布的測試結果,Sonnet 5.5在Terminal-Bench 4.0取得70.6%,高於Sonnet 5的10.3%及Opus 5.5的66.4%。在FrontierCode 1.1 Main測試中,Sonnet 5.5採最高推理設定取得46.2%,優於Sonnet 5的42.4%,但仍落後Opus 5.5的54.4%與GPT-6 Sol的49.3%。
GDPval-AA v2.1方面,Sonnet 5.5獲得1844分,接近Opus 5.5的1846分,並高於Sonnet 5的1449分及GPT-6 Sol的1487分。在Humanity's Last Exam測試中,Sonnet 5.5成績為64.5%,高於Sonnet 5的54.9%,但低於Opus 5.5的67.7%。OSWorld 2.1也呈現類似結果,Sonnet 5.5取得80.1%,介於Sonnet 5的57.0%與Opus 5.5的81.8%之間。
Anthropic公開的比較表顯示,Opus 5.5在FrontierCode、CursorBench、GDPval-AA、AA-Briefcase及Humanity's Last Exam等項目仍領先Sonnet 5.5。公司也坦言,面對需要持續判斷的複雜、開放式任務,Opus 5.5依然明顯較強。
獨立評測排名前段,但輸出偏冗長
獨立評測機構Artificial Analysis給予Claude Sonnet 5.5的智慧指數56分,在216個模型中排名第3,高於26分的中位數。該機構測得每項任務成本為7.60美元,評測期間總輸出達4.10億個權杖,遠高於8800萬個權杖的中位數,因此將其評為「非常冗長」。
Artificial Analysis測得Sonnet 5.5每秒可輸出141.9個權杖,速度排名第28;不過首個權杖的等待時間達353.32秒。
在Vals AI評測中,Sonnet 5.5以69.22%正負0.96個百分點的Vals指數,在66個模型中排名第2。Opus 5.5以69.69%領先0.47個百分點,但每次測試成本為32.77美元,高於Sonnet 5.5的20.80美元。
Sonnet 5.5並非在所有領域都位居前段。它在CyberBench僅取得59.58%,於41個模型中排名第31;在Harvey's Legal Agent Benchmark則獲得2.92%,於70個模型中排名第36。
企業測試稱速度提升,特定領域可能觸發防護
VentureBeat引述Box副總裁Yashodha Bhavnani表示,Sonnet 5.5速度提升至2.4倍,整體權杖用量減少12%。SiliconANGLE引述Zendesk人工智慧主管指出,模型讓客服案件處理速度加快20%,有助於減少顧客等待時間。該媒體另稱,Sonnet 5.5是首款僅靠遊戲畫面截圖便能破關《寶可夢 紅版》的Sonnet模型。
安全機制方面,Anthropic表示,生物安全防護可能誤擋部分微生物學與病毒學請求。SiliconANGLE指出,相關防護也可能在網路安全、生物學及敏感內容情境啟動,但多數軟體開發與生命科學工作不會受到影響。
留言
張貼留言