本文へスキップ
Edition · Tokyo

Claude Opus 5の実力:Fable級を半額で使えるのか

Claude Opus 5の実力、料金、Fable 5・Sonnet 5との違い、Claude CodeとAPIの移行注意点を、Anthropic公式情報から実務目線で解説します。

codeagent.jp編集部 情報確認 約11分
Tags
情報確認
参考リンク
5件
更新性
定期更新
読了目安
約11分
更新管理

仕様・料金・提供範囲が変わりやすいテーマは、公開日・更新日・情報確認日を分けて管理します。 導入前には必ず記事末尾の一次情報と公式ドキュメントで最新状況を確認してください。

Claude Opus 5の実力:Fable級を半額で使えるのか の16:9共有用サマリー画像。 結論は「Opus 4.8からは強く推奨、Fable 5からは用途次第」。性能単価と運用自由度が新しい基準になる 1. 実力: 難問コーディング性能が4.8から大幅向上、CursorBenchでFable 5と0.5%差 2. コスト: 通常APIは$5 / $25で4.8据え置き、Fableの半額、Fastは2倍単価 3. 移行: thinking既定ON、max_tokensを再設計、冗長さ・検証・委任を明示制御 結論: まず既存タスク10〜20件でOpus 4.8と比較し、low〜xhighの最小十分なeffortを決める
Claude Opus 5の実力:Fable級を半額で使えるのか 資料 26-AKLM 2026.07.25 ニュース・政策動向
共有用画像を開く シェア 約11分 / claude / claude-opus-5

結論:Opus 5は「普段使えるFable級」に近づいた

Claude Opus 5の実力を一言で表すなら、Fable 5に迫る難問処理を、Opus 4.8と同じ単価で日常運用できるモデルです。Anthropicは2026年7月24日、Opus 5を全プラットフォームで提供開始しました。通常API料金は100万トークンあたり入力5ドル、出力25ドル。Fable 5の入力10ドル、出力50ドルに対して半額です。(Anthropic)

進化が大きいのは、短い質問への回答よりも、複数ファイルの実装、根本原因の調査、ツールをまたぐ業務自動化、長い分析です。Anthropicの公式評価では、Frontier-Bench v0.1でOpus 4.8の性能を2倍以上に伸ばしながら、1タスクあたりの費用を下げました。CursorBench 3.2では、max effort時にFable 5のピークスコアとの差が0.5%以内とされています。(Anthropic)

ただし「Fable 5が不要になった」とまでは言えません。最長時間の自律作業や、サイバーセキュリティ、先端的な生命科学では、Fable 5/Mythos 5が上位です。Opus 4.8からの移行は強く検討する価値があり、Fable 5からの移行はタスクごとに判断する、というのが2026年7月25日時点の現実的な結論です。

$5 / $25
通常API単価
入力 / 出力、各100万トークン
1M
コンテキスト
標準かつ最大のウィンドウ
約2.5×
Fast mode
通常モードに対する速度
Anthropic公式発表・開発者向けドキュメントを2026年7月25日に確認。

Claude Opus 5の基本スペック

項目Claude Opus 5
APIモデルIDclaude-opus-5
コンテキスト100万トークン
最大出力12万8,000トークン
effortlow / medium / high / xhigh / max
thinking既定で有効
通常料金入力$5 / 出力$25(各100万トークン)
Fast mode料金入力$10 / 出力$50(各100万トークン)
提供先Claude、Claude Code、Claude API、AWS、Google Cloud、Microsoft Foundry

1Mトークンは追加オプションではなく、標準かつ最大のコンテキストです。最大出力は128k。APIではclaude-opus-5、Amazon Bedrockではanthropic.claude-opus-5を使います。Fast modeは現時点でClaude APIのResearch Previewであり、AWS、Google Cloud、Microsoft Foundryでは使えません。(Claude Platform: What’s new)

Claudeの有料プランでは全プランから利用でき、Maxの既定モデル、Proで選べる最上位モデルになりました。GitHub CopilotでもPro+、Max、Business、Enterprise向けに段階展開され、VS Code、CLI、クラウドエージェント、JetBrains、Xcodeなどから選べます。Business/Enterpriseでは管理者によるモデルポリシーの有効化が必要です。(Anthropic)(GitHub)

ベンチマークで見えるOpus 5の実力

コーディング:4.8からは世代差、Fableとは僅差

AnthropicはOpus 5を、Opus 4.8の小幅更新ではなく「step-change improvement」と位置づけています。特に伸びたのは、難しいコーディング、深い推論、長時間のエージェント作業、追加の推論量を成果へ変える能力です。(Claude Platform: What’s new)

公表された主な結果は次の通りです。

  • Frontier-Bench v0.1:Opus 4.8の性能を2倍以上にし、1タスクあたりの費用は低下
  • CursorBench 3.2maxでFable 5のピークスコアとの差が0.5%以内
  • 実在バグの修正例:表面症状だけでなく、コミュニティの修正が見落とした境界条件まで修正
  • 市場データフィード構築例:検証用の実データがない状況で、自らテストハーネスを作ってパーサーを確認

この並びから見えるのは、単なるコード生成量の増加ではありません。実装前に原因を絞り、必要なら検証手段そのものを作り、完了条件まで到達する能力が強化されています。GitHubも早期評価で、対象を絞った変更、回帰確認、複数ツールの連携、不要な実行の削減を強みとして挙げています。(Anthropic)(GitHub)

一方で、Frontier-Benchの公表値はmini-SWE-agent、Google Kubernetes Engine上の独自実行、各タスク5回の平均です。Opus 5とFable 5で安全分類器が拒否した場合はOpus 4.8へフォールバックしています。モデル名だけを比較した純粋な能力差ではなく、ハーネスとフォールバックを含む製品評価として読む必要があります。(Anthropic)

知識作業とPC操作:低effortでも強い

コーディング以外でも、コスト性能の改善が目立ちます。

  • ARC-AGI 3:未知の問題を解く評価で、次点モデルの約3倍
  • Zapier AutomationBench:同程度の1タスク費用で、次点の約1.5倍の合格率
  • OSWorld 2.0:Fable 5の最高結果を、約3分の1強の費用で上回る
  • 低effortのAutomationBench:最小設定でも、比較対象の全モデルより多くのタスクに合格

実務で重要なのは最後の点です。最高設定で勝つだけなら、費用と待ち時間を無視したデモになりがちです。Opus 5はlowmediumでも品質を残しやすく、簡単な処理までxhighmaxにする必要がありません。Anthropicも、以前のモデルからeffortの既定値をそのまま移さず、自社評価で設定ごとの性能と費用を取り直すよう案内しています。(Claude Platform: Prompting)

科学・ビジョン:コード以外も着実に伸びた

生命科学の社内評価では、Opus 5はOpus 4.8を全項目で上回ったとされています。分光データから分子構造を推定する有機化学タスクで10.2ポイント、タンパク質配列の変異が機能へ与える影響の予測で7.7ポイント向上しました。(Anthropic)

ビジョンでは、グラフ、文書、図の理解、スクリーンショットからのUI再現が強みです。公式ガイドは、思考量だけを増やすより、画像の切り出し、拡大、ブラウザ確認などのツールを与え、反復的に検証させるほうが費用対効果に優れると説明しています。(Claude Platform: Prompting)

Opus 5、Fable 5、Sonnet 5の違い

Opus 5
Fable 5
位置づけ
日常運用できる高性能モデル
最長・最難関の自律タスク向け
入力 / 1M
$5
$10
出力 / 1M
$25
$50
一般的なコーディング
第一候補
限界性能が必要なら候補
データ保持要件
追加要件なし
30日保持が必要
安全分類器
限定的
広範囲
一般提供モデルの実務上の違い。価格と仕様は2026年7月25日時点。

Opus 5を選ぶ

複数ファイルの実装、難しいデバッグ、コードレビュー、調査、文書・表計算・スライド作成など、品質が重要だが継続的に使う仕事の第一候補です。標準料金がOpus 4.8と同じため、4.8を使っている組織は移行評価を始める合理性があります。

Fable 5を選ぶ

数時間から数日に及ぶ自律作業、限界性能が成果を左右する研究、最も難しいエージェント作業が対象です。ただし料金はOpus 5の2倍で、30日間のデータ保持要件があります。Fableの安全分類器は広く、サイバー、生命科学、モデル蒸留に関連する一部要求を別モデルへ回します。

Sonnet 5を選ぶ

大量処理、日常的な軽〜中規模実装、速度とコストを優先する処理に向きます。Opus 5で設計・レビューを行い、Sonnet 5で定型実装や反復処理を回す構成も現実的です。すべてをOpus 5へ寄せるより、失敗コストが高い工程だけを昇格させるほうが総費用を管理しやすくなります。

Opus 4.8からの移行で変わること

1. thinkingが既定で有効になる

Opus 4.8は、明示しなければthinkingなしで動きました。Opus 5ではthinkingが既定で有効になり、各ターンでモデルが必要な思考量を決めます。max_tokensは思考と回答を合わせたハード上限なので、4.8で小さく設定していた場合は、途中終了やツール実行余地の不足が起きます。(Claude Platform: What’s new)

from anthropic import Anthropic
client = Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=64000,
output_config={"effort": "xhigh"},
messages=[
{
"role": "user",
"content": "この変更の根本原因を特定し、回帰テストを追加して修正してください。",
}
],
)

thinkingを使うための指定は不要です。thinking: {"type": "disabled"}high以下でだけ使え、xhighまたはmaxと組み合わせると400エラーになります。思考を無効にした場合、ツール呼び出しが本文へ漏れたり、内部XMLタグが表示されたりすることがあるため、公式ガイドはthinkingを有効にしたままeffortで費用を調整する方法を推奨しています。(Claude Platform: What’s new)

2. 古い「再確認」指示が過剰動作を招く

Opus 5は指示がなくても自分の作業を検証します。そのため、Opus 4.8向けに追加した「最後に必ず再確認する」「別エージェントで検証する」「二重にチェックする」といった指示は、品質を上げずにトークンと時間だけを増やす可能性があります。(Claude Platform: Prompting)

移行時には、次のような重複指示を削るか、範囲を限定します。

  • 全作業で検証用サブエージェントを起動する
  • 修正後に同じ観点で何度も再レビューする
  • 明確な小変更でも詳細な計画書を作る
  • 実装と無関係な改善まで自主的に追加する

3. 応答が長く、進捗実況が増えやすい

Opus 5は、既定の回答とファイル成果物が4.8より長くなりやすく、エージェント作業中の進捗説明も増えます。effortは思考量の設定であり、見える文章量を直接は制御しません。短くしたい場合は、「結論を先に」「進捗は重要な発見か方針変更時だけ」「成果物は必要な長さに限定」と明示します。(Claude Platform: Prompting)

また、Opus 5はサブエージェントへ委任しやすいモデルです。小さな仕事で並列化すると費用が膨らむため、エージェント基盤では起動数の上限と、委任してよいタスクの大きさを決めておくべきです。

4. キャッシュとツール変更は使いやすくなった

プロンプトキャッシュの最小長は、Opus 4.8の1,024トークンから512トークンへ下がりました。以前は短すぎたシステムプロンプトでも、コード変更なしでキャッシュ対象になる可能性があります。(Claude Platform: What’s new)

ベータ機能では、会話途中でツールを追加・削除してもプロンプトキャッシュを維持できる「mid-conversation tool changes」と、安全分類器に止められた要求を推奨モデルへ回す「automatic fallbacks」も追加されました。前者はmid-conversation-tool-changes-2026-07-01、後者の既定フォールバックはserver-side-fallback-2026-07-01のベータヘッダーが必要です。

安全性とフォールバックの実務影響

Anthropicの自動行動監査では、Opus 5のmisaligned behavior総合値は2.3で、直近モデルの中で最も低いと報告されています。欺瞞的な挙動、悪用への追随、取り返しにくい副作用を伴う軽率な行動が少ない、という評価です。(Anthropic)

サイバー分野では、ソースコードからの脆弱性発見は許可する一方、バイナリを使う脆弱性探索、侵入テスト、エクスプロイト生成を分類器で制限します。分類器の介入頻度はFable 5より約85%低い見込みです。Claude、Claude Code、Coworkでは対象要求をOpus 4.8へ自動で回し、APIではフォールバックを任意で有効化できます。(Anthropic)

これは「Opus 5を選んだリクエストが常にOpus 5だけで完結する」とは限らないことを意味します。監査ログ、モデル別の品質測定、費用計算では、要求モデルと実際に処理したモデルを分けて記録する設計が必要です。

導入時のおすすめ設定

仕事推奨effortモデル選択の考え方
小さな修正、分類、整形lowSonnet 5とも比較する
日常の機能実装mediumOpus 5の性能単価を確認する
難しいバグ、コードレビューhighまずOpus 5を候補にする
大規模改修、長時間エージェントxhighOpus 5を基準にFable 5と比較
単一の最難関タスクmax費用上限と完了条件を明示する
対話中の待ち時間が重大任意 + Fast2倍単価に見合う場面だけ使う

Anthropicは、コーディングとエージェント作業ではxhighを開始点として案内しています。ただし、本番運用では全タスクをxhighへ固定するより、lowからxhighの各設定を同じ評価セットで比較し、合格条件を満たす最小設定を選ぶほうが堅実です。(Claude Platform: Prompting)

本番移行チェックリスト

Opus 4.8から移行する場合は、モデルIDの置換だけで終わらせず、次を確認してください。

  • claude-opus-4-8claude-opus-5へ変更した
  • max_tokensにthinkingとツール実行の余地がある
  • thinking: disabledxhighmaxを併用していない
  • lowxhighで品質、費用、所要時間を比較した
  • 過剰な再確認・検証・サブエージェント指示を削った
  • 進捗報告と最終回答の長さを明示した
  • 10〜20件の実タスクで4.8との回帰評価を通した
  • 安全分類器による拒否・フォールバックを監視できる
  • Fast modeを使う処理だけ2倍単価で予算化した
  • AWS/Google Cloud/Microsoft FoundryではFastを前提にしていない

評価セットには、成功した仕事だけでなく、4.8で失敗した難問、曖昧な依頼、途中でツールが失敗するケース、長い文脈、セキュリティに近い正当な開発作業を含めます。合格率だけでなく、総トークン、所要時間、ツール回数、不要な差分、再試行数も記録すると、Opus 5の性能単価を判断できます。

まとめ:4.8の置き換え候補、Fableの全面代替ではない

Claude Opus 5は、Opus 4.8から大きく進化し、Fable 5に近い性能を半額で使える場面を増やしました。特に、長いコーディング作業、根本原因分析、自己検証、低effortでの効率は、本番のエージェント運用に直結します。

一方で、公式ベンチマークはハーネス、effort、フォールバックを含む評価です。自社のコードベースや業務で同じ差が出る保証はありません。既存タスク10〜20件を固定し、Opus 4.8とOpus 5を同条件で比較してから切り替えるのが最短です。

判断基準は次の3つに絞れます。

  1. Opus 4.8を使っている:Opus 5への移行評価を始める
  2. Fable 5を使っている:限界性能と30日保持要件を含め、タスク単位で比較する
  3. Sonnet 5で足りている:無理に上げず、難しい工程だけOpus 5へルーティングする

Opus 5の強みは「最高スコア」だけではありません。高性能を、通常業務へ載せられる価格と設定幅で提供したことです。導入の成否は、maxを選ぶことではなく、仕事ごとに最小十分なeffortを決められるかで分かれます。

次に読む

Primary sources

一次情報・参考リンク

About the author
codeagent.jp編集部

Claude Code / Codex / MCP を個人開発サイト運用と公開MCPサーバー開発で試し、一次情報・検証ログ・失敗例をもとに整理します。

関連して読む