Anthropicは9月28日、Claude Sonnet 5.5をSonnet 5と同じ価格で発表した。新モデルは処理速度が30%以上速く、1タスク当たりのコストは最大30%削減できるという。
一方、第三者のベンチマーク企業は、同モデルを限界まで活用した場合のコストに関して異なる結論を示した。
Anthropic、Opusに続き2機種目の5.5モデルを投入
Sonnet 5.5はClaude 5.5ファミリーで2番目となるモデルである。Anthropicは9月22日にOpus 5.5を発売した。同日にはOpenAIもGPT-6 SolおよびLunaをリリースしている。
新モデルは、入力100万トークン当たり2ドル、出力100万トークン当たり10ドルというSonnet 5の価格設定を維持した。Anthropicは、エージェント型コーディングテストであるTerminal-Bench 4.0で70.6%というスコアを報告。Sonnet 5は10.3%、Opus 5.5は66.4%だった。
「Opus 5.5が精緻な判断が求められる複雑な業務向けなら、Sonnet 5.5は日常的なタスクやバグ修正、資料・スライド・スプレッドシートといった綿密なドキュメント作成に最適である」と同チームは述べた。
Anthropicは、Sonnet 5.5が能力の上限を拡大したものではないと説明した。リスクとしては、ユーザーを欺くことや重大な誤用への加担に注目してアラインメントレビューを実施した。
Sonnet 5.5にはサイバーセーフガードやアンチ・ディスティレーションクラス分類器も組み込まれている。これにより他のモデルへの学習用としてモデルの推論過程を抽出しようとする試みをブロックする。Claude Haiku 5.5も数週間後に登場予定。
一方、OpenAIは新モデルGPT-6.1 Astraの公開を安全性の懸念を理由に棚上げした。CNBCは月曜日、同モデルが社内基準に達しなかったことを確認した。
Artificial Analysis、最大稼働時のトークン消費増を指摘
Grok 4.7を第4位にランク付けしたベンチマーク企業Artificial Analysisは、Sonnet 5.5にインテリジェンス指数で56点をつけた。Opus 5.5は最大努力時で58点と、2点上回った。
Terminal-Bench 4.0ではSonnet 5.5が64%、Opus 5.5やGPT-6 Astraが60%だった。GDPval-AAなどの知識ワーク系テストでもSonnet 5.5とOpus 5.5はほぼ同等の結果が出た。
同社は、これらを達成するためにSonnet 5.5が大幅に多くのトークンを消費したと指摘した。
「最大稼働時、Opus 5.5に迫る性能となるが、Claude Sonnet 5.5はインテリジェンス指数タスクごとに約19万3000出力トークンを消費した」と投稿は述べている。
この値はOpus 5.5およびSonnet 5の最大稼働時より約60%多く、GPT-6 Astraの最大稼働時のおよそ7倍である。
一方、Anthropicが引用した先行アクセス利用者からは、異なる作業負荷下でSonnet 5と比較してトークン使用量が減ったという報告もあった。Balyasny Asset Managementでは金融タスクで大幅なトークン削減が見られた。
「Q&A、抽出、分析、予測など2,441の金融タスクで、Claude Sonnet 5.5はSonnet 5を上回った上で、1回答当たり約12万1000トークンだった。Sonnet 5は49万7000トークンを使用していた」とBalyasny Asset ManagementのシニアAIエンジニア、ジョー・ポワリエ氏は述べた。
Artificial Analysisは、Anthropicがその後修正した構造化出力のバグを持つ事前リリース版でテストを実施した。同社は近く、該当評価の再実施を予定している。
YouTubeチャンネルに登録して、リーダーや記者による専門インサイトを視聴









