1. 何が実際に公開されたのか
Anthropicは2026年7月24日、Claude API、Amazon Bedrock、Google CloudでClaude Opus 5の提供を開始した。難度の高いソフトウェア開発と知識労働の「日常モデル」と位置づけ、Claude Fable 5に近い能力をFableの半分のトークン価格で提供すると説明している。
公式文書の基本価格はOpus 4.8と同じで、入力100万トークン当たり5ドル、出力100万トークン当たり25ドル。既定のコンテキストは100万トークン、最大出力は12万8千トークンである。仕様と提供経路は確認済みだが、性能優位はベンダー報告であり、独立評価と実業務での検証が必要だ。
2. 「良い回答」から「安定した作業者」へ
発表は複数ファイルの実装、長いツール利用、結果検証、高いeffortでの性能向上といった長時間作業に重点を置く。AnthropicはOpus 4.8比で深い推論、エージェント型コーディング、長期タスク、テスト時の計算量拡張が大きく改善したとしている。
エージェントの価値は一つの回答品質では決まらない。人が介入した回数、手戻りなしで完了した割合、次工程へ誤りが波及する前に自己検出できたかが重要だ。企業評価はこの指標を中心に設計すべきである。
3. トークン単価よりタスク経済性
公表基本価格では、入力10万トークン、出力1万トークンの仮想リクエストは、キャッシュ・ツール・クラウド料金を除き約0.75ドルとなる。入力0.50ドル、出力0.25ドルの単純計算であり、実際の業務価格を保証するものではない。
高価なモデルでも試行回数を減らせれば総コストは下がり得る。追加思考と出力が成果を改善しなければ逆に高くなる。承認された成果物一件の費用、経過時間、エンドツーエンド成功率を測り、low・medium effortも品質と遅延の調整手段として試すべきだ。
- リクエスト単価ではなく成功タスク単価を測る。
- モデル遅延と外部ツール遅延を分ける。
- 反復コンテキストではプロンプトキャッシュを試す。最小長は512トークン。
- 強いモデルの一回実行と、安価なモデルの反復修正を比較する。
4. 移行はモデル名の変更だけではない
Opus 5は適応的思考が既定で有効になり、effort値で深さを制御する。xhighまたはmaxで思考を無効にすると400エラーになる。モデルは自ら検証し進捗を詳しく説明する傾向があるため、従来プロンプトの重複した検証指示は過剰作業を生む可能性がある。
運用上の制約もある。現時点でweb fetchとPriority TierはOpus 5に対応していない。旧世代から移行するチームはサンプリング引数、手動思考設定、assistant prefill、トークン計算を再点検する必要がある。
5. 日本企業への示唆
英語のコーディング評価だけで導入を決めてはいけない。日本語の契約書、製造仕様、稟議、顧客対応、日英混在文書、国内の日付・数値表記を含む評価セットを作り、業務フロー全体の成功率を測る必要がある。
BedrockやGoogle Cloudでの提供は、国内データ要件を自動的に満たすことを意味しない。処理地域、保持方針、監査ログ、エージェントのツール権限を契約と技術の両面で確認する。製造・ロボティクス領域では長い技術資料とツール分析に可能性がある一方、検証なしの自動実行は避けるべきだ。
6. 2週間で行う購入テスト
価値の高い実タスクを10〜20件選び、実行前に合格基準を決める。Opus 5を二つのeffort水準で現行モデルと比較し、総費用、所要時間、人の介入、重大な誤り、引用や成果物の品質を記録する。
完了率の改善がコストに見合うならルーティングを使う。定型業務は軽量モデルに残し、曖昧または高リスクな案件のみOpus 5へ上げる。権限、安全停止、監視、ロールバックを試すまでは本番投入しない。