Anthropic推出Claude Haiku 5.5 長文本採分級計價、獨立評測排名第2

Anthropic推出Claude Haiku 5.5 長文本採分級計價、獨立評測排名第2

有助於理解文章的圖片

主打速度與較窄範圍任務

人工智慧公司Anthropic於2026年10月7日(當地時間)發布小型模型Claude Haiku 5.5,宣稱若以各模型的標準速度比較,這是該公司至今最快的模型,但仍慢於啟用快速模式(Fast Mode)的Opus。Anthropic將其定位為適合範圍較窄的任務,而非複雜的代理式程式開發。

Claude Haiku 5.5的上下文視窗由Haiku 4.5的20萬權杖擴大至100萬權杖,最大輸出也從6.4萬提高至12.8萬權杖。Claude API模型識別碼為「claude-haiku-5-5」,已於Claude Platform、Amazon Web Services、Google Cloud及Microsoft Azure提供。

長文本請求導入分級費率

Haiku 5.5針對長文本請求採分級計價,兩個區間的輸出費用分別為0.50美元與2.50美元,快取讀取為0.01美元與0.05美元,快取寫入則為0.125美元與0.625美元。Anthropic表示,綜合請求規模與權杖切分器變更後,執行工作負載的成本較Haiku 4.5約低75%。VentureBeat報導,GPT-6 Luna包含快取在內的4項費率,與Haiku 5.5較低用量區間相同。

新權杖切分器會讓相同輸入句子比Haiku 4.5多產生約30%權杖。Anthropic公告僅稱每項工作的權杖用量略增,平台文件則進一步列出約30%的幅度。最低可快取提示詞長度由4,096權杖降至512權杖。

官方測試全面落後Sonnet 5.5

Anthropic公布的評測顯示,Haiku 5.5在GDPval-AA v2.1、AA-Briefcase v1.1及OSWorld 2.1分別取得1,620分、1,578分與72.4%;Haiku 4.5為735分、614分與15.7%,GPT-6 Luna則為1,437分、1,336分與48.9%。同一批測試中,Claude Sonnet 5.5分別達1,840分、1,824分與83.9%,均高於Haiku 5.5。

Anthropic註明,GDPval-AA與OSWorld使用可從低至最高調整的推理投入設定,但未交代各項成績採用的個別設定。Humanity's Last Exam測試中,Haiku 5.5在不使用工具及使用工具時分別取得45.9%與57.4%,高於Haiku 4.5的10.2%與18.7%,但仍落後Sonnet 5.5的56.9%與64.5%。這項測試同樣套用可調整的推理投入設定。

Haiku 5.5在Terminal-Bench 4.0採最高推理投入時取得39.2%,中等投入約20%。FrontierCode 1.1 Main測試中,Haiku 5.5為46.4%,Sonnet 5.5為52.1%,GPT-6 Luna為42.4%,未公布Haiku 4.5成績。未使用工具的Chartography測試則依序為Haiku 5.5的46.4%、Haiku 4.5的6.4%、Sonnet 5.5的61.6%及GPT-6 Luna的29.1%。Anthropic公布的所有評測項目中,Sonnet 5.5皆高於Haiku 5.5。

獨立機構評為180款模型第2名

獨立評測機構Artificial Analysis將Claude Haiku 5.5設定為最高推理投入後,在Intelligence Index給予43分,名列180款模型第2,同等價位模型的中位數僅13分。該機構測得其輸出速度為每秒240.4權杖,排名第9;每項工作成本為0.21美元,排名第46。

截至檢視時,LMArena、Vals AI、SWE-bench及Aider尚未公布Haiku 5.5成績。企業自行測試方面,Box表示,在延遲約為Haiku 4.5一半的條件下,新模型得分高出11分;HubSpot公布其執行3次客戶關係管理任務的平均成績為92.8%;Asana則稱延遲降低逾30%,每回合代理推理速度最高加快2.5倍。

API相容性與安全限制

Amazon Bedrock上的模型識別碼為「global.anthropic.claude-haiku-5-5」,可透過bedrock-runtime在美國、歐盟、澳洲、日本及全球CRIS推理設定檔使用;AWS GovCloud(美國)則支援bedrock-runtime與bedrock-mantle。不過,Amazon Bedrock目前不支援Haiku 5.5的結構化輸出。

Haiku 4.5原本支援的budget_tokens手動延伸思考、temperature、top_p與top_k自訂取樣,以及助理訊息預填功能,在Haiku 5.5上都會回傳錯誤。Anthropic表示,新模型的資安防護比Haiku 4.5嚴格,但比其他近期模型稍寬鬆,且仍會封鎖滲透測試。

Unite.AI引述系統卡內容指出,面對意圖不明的情境時,Haiku 5.5協助撰寫自殺遺書的頻率高於Haiku 4.5;另一方面,Anthropic的行為稽核也發現,Haiku 5.5出現過度拒絕要求的情形比其他模型更多。

Source: Original Korean article - Trendy News Korea

留言