Anthropic推Claude Opus 5.5 執行成本降四成、生成速度提升逾三成

Anthropic推Claude Opus 5.5 執行成本降四成、生成速度提升逾三成

有助於理解文章的圖片

首款5.5系列模型主打降價增速

美國人工智慧公司Anthropic於9月22日(韓國時間23日)發布Claude Opus 5.5,這也是Claude 5.5系列首款模型。Anthropic表示,新模型在多數任務上的表現可達Claude Fable 5.1水準,但執行成本較Opus 5降低40%,輸出生成速度則提升超過30%。

Claude Opus 5.5的API價格以每100萬個權杖計算,輸入為4美元、輸出為20美元,低於Opus 5的輸入5美元與輸出25美元。新模型已在Anthropic Claude平台、亞馬遜網路服務(AWS)、Google Cloud及Microsoft Azure提供,API模型識別碼為「claude-opus-5-5」。

程式編寫評測與GPT-6 Astra互有勝負

Anthropic公布的FrontierCode v1.1測試結果顯示,Opus 5.5得分54.4%,略高於GPT-6 Astra的53.3%。公司宣稱,Opus 5.5在預設的中等運算強度設定下,已超越Astra的最高成績,每項任務成本則約為其五分之一。

在Terminal-Bench 4.0測試中,Anthropic稱Opus 5.5能以約四成成本達到與GPT-6 Astra相當的表現。公司表格所列的最高運算強度成績,Opus 5.5為66.4%,Astra則為57.9%。

不過,Astra在部分項目仍占上風。Terminal-Bench-Science 0.1測試中,Astra與Opus 5.5分別取得64.6%及58.7%;AutomationBench則分別為41.4%與40.0%。至於CursorBench 4.0,Opus 5.5得分57.8%,高於GPT-5.6 Sol的41.7%,但未公布Astra成績。

上述數據均由各家公司自行發布,尚未獲得獨立重現。獨立評測機構Vals AI直接測試兩款模型後,認為雙方表現幾乎相當,但Astra略微領先。Digital Applied則指出,差距不到5個百分點時,在親自測試前不宜斷定優劣;整體而言,Opus 5.5在價格及多數共同基準測試占優勢,Astra則在自動化與科學項目維持領先。

安全性表現提升,但評估仍有盲點

Anthropic表示,Opus 5.5在公司內部的自動化行為稽核中,取得歷來最高分。模型試圖超出允許範圍的情況較Opus 5減少約85%,提示詞注入攻擊成功率也與Fable 5.1同列最低。涉及網路安全及生物學的工作,則設有轉交其他模型處理的安全機制。

公司同時坦承,目前仍無法建立一套能在部署前可靠找出所有失敗情況的評估制度,相關技術問題尚未解決。Anthropic也觀察到,Opus 5.5經常出現懷疑自己正接受評測的跡象,可能影響外界解讀測試結果。

執行長倡議放慢能力推進後推出

這是Anthropic執行長達里奧・阿莫迪提出應調節AI能力發展速度後,公司發布的首款模型。阿莫迪表示,調整步調是為了讓風險防範措施有時間跟上能力進展。

OpenAI已於9月3日限量開放GPT-6 Astra,Anthropic則在9月初推出Claude Fable 5.1與Claude Mythos 5.1。Opus 5.5此次以降低成本及加快生成速度切入,也使大型AI模型之間的競爭進一步延伸至價格、效能與安全性評估。

Source: Original Korean article - Trendy News Korea

留言