# Python 正答率 44.3%！JetBrains CTO が明かす Claude Fable 5 の実力と使い分け術

やっほー、しぃちゃんだよ！今日は Claude Blog に載ったインタビュー記事を紹介するね。開発ツールで有名な会社が、実際どうやって最新モデルを評価して使っているのか、すごく気になる内容だったの！

## なにが発表されたの？

Claude Blog に掲載された記事「Securing the frontier: How JetBrains evaluates and deploys Claude Fable 5」で、IntelliJ IDEA や PyCharm、Kotlin で知られる JetBrains の CTO、Vladislav Tankov さんへのインタビューが公開されたよ。JetBrains は 1250 万人以上のアクティブユーザーと Fortune Global 100 のうち 88 社を顧客に持つ開発ツール企業で、記事では同社が新しいモデルをどう評価し、いつ Claude Fable 5 を選ぶのか、そして安全性やデータ保持についてどう考えているのかが語られているよ。

## なぜ重要なの？

Tankov さんは JetBrains に 10 年在籍していて、LLM プロバイダーの初期の顧客の一人だったんだって。この 1 年で、社内や顧客の中にいた AI 懐疑派がほとんどいなくなったと語っていて、「文字通り社内の懐疑派は全員変わった」というくらい、フロンティア AI への向き合い方が大きく変化したそうだよ。

だからこそ、JetBrains のようなコーディング企業が「どうやってモデルを評価しているか」という話は重要なの。ベンチマークのスコアが高くても実務では通用しないモデルもある中で、JetBrains は自社のモノレポを含む非公開リポジトリを使った大規模な評価パイプラインを持っていて、品質・タスクあたりのコスト・速度でリーダーボードを作って比較しているんだって。

## これで何が変わるの？

- Claude Fable 5 は JetBrains の評価スイートで Python タスクの正答率 44.3% を記録し、Opus 4.8 の 28.2% から 16 ポイントの向上を見せたよ
- Python タスクの直接対決では、Claude Fable 5 が Opus 4.8 を 18 タスク上回り、負けたのはわずか 2 タスクだけだったんだって
- コードが実行できた場合にテストに通る割合も高く、答えの信頼性が上がったと Tankov さんは語っているよ
- 解決までに必要なステップ数は Opus 4.8 より約 22 パーセント少なく、試行錯誤が減って効率よく動くみたい

## 深く潜ってみよう

技術的に面白かったポイントをまとめるね。

- Java タスクでは、Opus 4.8 が役に立たない外部リソースを取り込もうとする傾向があった一方、Claude Fable 5 は目の前のコードだけで完結させる、より良いエンジニアリングの習慣を見せたんだって
- 使い分けとしては、Opus は「確実に仕事をこなすワークホース」、Claude Fable 5 は「良い推論力が欲しい、パートナーが欲しいとき」に使うという住み分けがあるみたい。ある技術リードが何度も挑戦して実現できなかったリッチテキストエディタを、Claude Fable 5 でほぼワンショットで実装できた例が紹介されているよ
- 長時間動くエージェント型コーディングの実験にも使われていて、仕様(テキストや画像)をエージェントに与えて IDE ライクなアプリを実装させたり、既存アプリからエージェント自身に仕様を生成させて、あるランタイムやフレームワークから別のものへほぼブラックボックスで書き換える取り組みもしているんだって
- セキュリティ面では、自社製品に対するホワイトボックステストで脆弱性を探すのに Claude Fable 5 を活用していて、社外の人が同クラスのモデルで脆弱性を探ってくることへの備えにもなっていると語られているよ
- データ保持については、本来はゼロ保持が理想としつつも、分類器が誤動作した場合を調べるために、最も深刻なケースに限ってレビューが行われる仕組みは公平なトレードオフだと考えているそうだよ
- Anthropic 側のレッドチーミングを信頼したうえで、JetBrains 側はモデル自体をいじるのではなく、モデルやハーネスの周りに安全網とインフラを作るというアプローチを取っているんだって

## まとめ

- JetBrains の CTO Vladislav Tankov さんが、Claude Fable 5 の評価結果と活用方法を Claude Blog のインタビューで語ったよ
- Python タスクの正答率は 44.3% で Opus 4.8 の 28.2% を大きく上回り、必要なステップ数も約 22 パーセント少なかったんだって
- 難しい推論が必要な場面や、答えが見えていないタスクで Claude Fable 5 を頼りにしているみたい
- セキュリティ調査やデータ保持の考え方についても、具体的な運用方針が語られているよ
- 大規模開発チームでのモデル評価の仕組みや、フロンティアモデルとの向き合い方を知りたいエンジニアリングリーダーに刺さる内容だと思うな！
