AnthropicがClaude Opus 5を公開しました。ソフトウェア開発や知識労働のベンチマークで高評価を獲得しつつ、価格はOpus 4.8と同水準です。Claude Maxの新デフォルトであり、Claude Proで最強モデルとして提供されます。Frontier-BenchやGDPval-AAで最高水準を示し、CursorBenchではFable 5のピークに0.5ポイント差まで迫りながら、タスク当たりコストは半分と説明されています。一方、サイバーセキュリティの攻撃面ではMythos 5が依然優位です。利用者はエフォート設定で賢さと速度やコストのバランスを調整できます。
ソフトウェア工学ではOpus 5が顕著に向上しています。Frontier-Bench v0.1で全モデルを上回り、Opus 4.8比で性能を倍増しながらコストを削減しました。CursorBench 3.2では最大エフォート時にFable 5に0.5ポイント差で、同タスクのコストは半分です。AA Coding Agent Indexなどでも高いコスト効率を示します。知識労働や問題解決でも、ARC-AGI 3で次点の約3倍、Zapier AutomationBenchで同コスト帯比約1.5倍の合格率、OSWorld 2.0では三分の一強のコストでFable 5の最高結果を上回るとされています。GDPval-AA v2やHLE、DeepSearchQAでも最良でコスト効率に優れます。
科学研究分野では生命科学系の全評価でOpus 4.8を上回りました。有機化学の分光解析による構造推定で10.2ポイント、タンパク質変異の機能予測で7.7ポイント改善しています。ビジュアル出力も強化され、空力可視化や細胞アーティファクトなどで表現が向上しました。実務ではデータ解析から可視化までの一貫フローが組みやすく、検証と反復設計の短縮が期待できます。検証能力と反復力も高まり、視覚入力不可の課題で自前のコンピュータビジョンを組み立てFreeCADモデルを再構築した事例が示されています。オープンソースの不具合修正や市場データフィード構築の例でも、根本原因の特定やテストハーネスの自動生成などの徹底ぶりが確認されています。
安全性では行動監査で整合性が最も高く、欺瞞行動が低く誤用誘導への耐性が強化されました。総合スコアは2.3とされています。サイバー領域では脆弱性の特定には強い一方、エクスプロイト開発はMythos 5に劣後します。ソースコードの脆弱性発見は許容しつつ、バイナリスキャンやペネトレーションテスト、エクスプロイト生成は遮断する設計です。CVP参加者には制限緩和版が提供されます。バイオ分野はOpus 4.8と同様のセーフガードを備え、長期自律研究には制約が残ります。
提供は即日で、価格は入力100万トークン5ドル、出力100万トークン25ドルです。Fastモードは標準の約2.5倍の速度で、価格は2倍です。会話中のツール切り替えやAPIの自動フォールバックなどのベータ機能も提供され、フラグ時はOpus 4.8へフォールバック可能です。データ保持要件は一般提供で不要です。導入時はエフォート設定とFastモードの使い分け、フォールバック設定の確認、目的タスクに合う評価指標の参照が有効です。
詳しくは「Anthropic」の公式ページまで。レポート/DXマガジン編集部






















