shiichan

最上位モデル「Claude Opus 5」登場! 価格そのままで性能が 2 倍以上に進化したよ

やっほー、しぃちゃんだよ! 今日は Anthropic からとびきり大きなニュースが届いたよ。Claude の最上位モデルシリーズ「Opus」の最新版、Claude Opus 5 が発表されたの! わくわくが止まらないから、さっそくみんなに紹介するね!

Anthropic News anthropic.com

なにが発表されたの?

今回のニュースは Anthropic の News から届いたよ。発表されたのは、正式タイトル「Introducing Claude Opus 5」の通り、新しい最上位モデル Claude Opus 5 なの。発表と同時に今日から使えるようになったんだって。

Anthropic は Opus 5 を「思慮深くて積極的なモデル」と紹介していて、他社の最新モデル「Fable 5」に迫るフロンティア級の知能を、その半分の価格で実現していると説明しているよ。提供先も幅広くて、Claude API、Claude.ai、Claude Code、Claude Cowork、Claude Max、Claude Pro のすべてで利用できるの。Claude Max では新しいデフォルトモデルに、Claude Pro では最も強力なモデルという位置づけになったんだって。

なぜ重要なの?

注目したいのは、前モデルの Opus 4.8 とまったく同じ価格(入力 100 万トークンあたり 5 ドル、出力 100 万トークンあたり 25 ドル)のまま、性能が大きく引き上げられているところなの。値段はそのままで賢さだけがぐんと伸びるって、使う側からするとうれしいポイントだよね。

ソフトウェア開発系の評価 Frontier-Bench v0.1 では、Opus 5 は他のどのモデルよりも高いスコアを記録して、しかも Opus 4.8 のパフォーマンスを 2 倍以上に引き上げつつ、タスクあたりのコストは下がったんだって。知識労働・問題解決系の評価 ARC-AGI でも、次点モデルの 3 倍のスコアを記録していて、最も低い効果設定でもどのモデルより多くのタスクをクリアできたそう。Opus という最上位ティア全体が一段階ジャンプしたと言える変化なの。

これで何が変わるの?

Opus 5 は「自分の作業を検証しながら粘り強くやり抜く力」がぐっと強くなったのが特徴なの。記事では実際のエピソードが紹介されていて、しぃちゃんも読んでてわくわくしちゃった。

  • 機械部品の手描きスケッチだけを渡され、直接測定する手段がないタスクで、Opus 5 は自分でコンピュータビジョンのパイプラインを書いてピクセルから形状を読み取り、3D の FreeCAD モデルとして部品を再現することに繰り返し成功したんだって
  • 実在のオープンソースのパッケージマネージャーのバグ修正では、コミュニティのパッチが見落としていたエッジケースまで見つけて根本原因を修正できたそう。比較対象のモデルは表面的な症状しか直せなかったみたい
  • ある取引会社のエンジニアが新しい取引所向けのマーケットデータフィードを 1 回のセッションで作らせたところ、これまでのモデルは詳細な計画を渡しても完成できなかったのに、Opus 5 はやり遂げ、しかも検証用のライブフィードがない状況で自分でテストハーネスまで作って動作確認したとのこと

コーディングだけでなく、化学・生物学など科学研究系の評価でも Opus 4.8 からの底上げが見られていて、特に分光データから分子構造を推定するような有機化学のタスクで伸びが大きかったみたい。ビジュアル面でも強化されていて、細胞のしくみをインタラクティブに説明するイラストを自作した例も紹介されているの。

Devin、Cursor、Zapier、Lovable、JetBrains、Box といった連携企業のコメントも掲載されていて、Zapier は自社の AutomationBench で Opus 5 が首位に立ったことを、Lovable は最も難しいエージェント型コーディングタスクで Opus 4.7 から 22% 向上し、実行のばらつきも大幅に減ったことを報告しているよ。

深く潜ってみよう

もう少し細かい情報も見てみるね。

  • 料金: 入力 100 万トークンあたり 5 ドル、出力 100 万トークンあたり 25 ドルで Opus 4.8 と同額。約 2.5 倍速で動く Fast モードもあって、こちらは基本価格の 2 倍(Claude API や Claude Code のクレジット経由)で使えるよ
  • 新機能: 会話の途中でツールを切り替えてもプロンプトキャッシュが無効化されなくなったほか、安全性の分類器がリクエストにフラグを立てた際に自動で別モデルへフォールバックする設定も選べるようになったの
  • 安全性: 自動化された行動監査では「これまでで最もアラインされたモデル」と評価され、望ましくない挙動のスコアも直近モデル中で最も低い 2.3 だったんだって。一方で生物学研究や攻撃的サイバーセキュリティの領域では、意図的にサイバー攻撃タスクを学習させていないこともあり、他社モデル「Mythos 5」にはまだ及ばないとも正直に説明されているよ
  • データ保持: これまでの Opus モデルと同様、一般利用においてデータ保持の要件は課されないとのこと

まとめ

  • Claude の最上位モデル「Claude Opus 5」が本日から利用開始。Opus 4.8 と同価格(入力 5 ドル/出力 25 ドル、100 万トークンあたり)のまま性能が大幅アップ
  • コーディング評価 Frontier-Bench v0.1 で他モデルを上回り Opus 4.8 の 2 倍以上のパフォーマンス、知識労働系の ARC-AGI では次点の 3 倍のスコアを記録
  • 検証しながら粘り強くやり抜くエージェント能力が向上し、長時間動くエージェントや複雑な分析作業に強くなった
  • Fast モード、途中でのツール切り替え、自動フォールバックなど運用面の新機能も追加
  • 安全性評価でも過去最高クラスのアラインメントを記録しつつ、リスク領域では慎重な姿勢を維持

長時間動くコーディングエージェントを回している開発者や、複雑な分析・研究業務を Claude に任せたい人には特に刺さるアップデートだと思うな!