# GPT-5.6、賢さと安さを同時に手に入れちゃったよ！

こんにちは、しぃちゃんだよ！今日は、OpenAI が新しいモデルをどうやって「賢いのに安い」に仕上げたのか、舞台裏を教えてくれる記事を見つけたよ。数字がいっぱいで読みごたえがあったから、みんなにも紹介しちゃうね！

## なにが発表されたの？

OpenAI の News から、GPT-5.6 モデルファミリーの効率化について、舞台裏を解説する記事が公開されたよ。GPT-5.6 には、フラッグシップの Sol、バランス型の Terra、いちばん軽くて安い Luna という 3 段階があって、それぞれ賢さとコストのバランスを変えているんだって。

具体的には、こんな成果が紹介されているよ。

- Sol（max reasoning）は、Artificial Analysis の Coding Agent Index で Claude Fable 5 を上回りながら、コストは半分以下
- Terra は、知能ベンチマークで GPT-5.5 と同じくらいの実力を、半額で発揮
- Luna は、いちばん速くていちばん安いモデルで、Sol より 80 %も安い価格

こういう成果を支えているのは、モデルの学習の仕方だけじゃなくて、推論（モデルを動かして答えを作る仕組み）と、Codex や ChatGPT Work が使っているエージェントの土台（agentic harness）、両方の作り込みなんだって。

## なぜ重要なの？

OpenAI は、この 4 年間でモデルの利用者を 10 億人、利用企業を 200 万社以上にまで増やしてきたんだって。使う人がここまで増えると、賢さをただ追い求めるだけじゃなくて「同じハードウェアでどれだけ多くのユーザーに答えを届けられるか」がすごく大事になってくるの。

しかも今は、モデルへの需要の伸びに計算リソースの伸びが追いつかない「計算資源が足りない世界」なんだよね。だから、推論のスタック（モデルを動かす仕組み全体）を一つひとつ工夫して、同じ GPU からより多くのトークンを引き出すことが、みんなに賢い AI を届け続けるための生命線になっているの。

## これで何が変わるの？

この効率化のおかげで、開発者や企業がうれしいポイントはこんな感じだよ。

- 同じ予算で、より賢いモデルやより多くのリクエストを使えるようになる
- Sol・Terra・Luna という選択肢が増えて、用途やコストに合わせてモデルを選びやすくなる
- 推論側の改善はレイテンシの減少や利用可能量の増加にもつながるから、大規模に使うほど恩恵を感じやすい

そしてもうひとつ面白いのが、これらの最適化の多くを GPT-5.6 Sol 自身が Codex を使って自律的に手がけたっていう話。AI が自分自身の推論基盤を改善する仕事を担っているんだね。

## 深く潜ってみよう

記事では、推論の最適化と、エージェントの土台の最適化を分けて紹介しているよ。

### 推論まわりの最適化

- **ロードバランシング**：地域や空きキャパシティ、アクセラレータの種類でリクエストを振り分け、クラスタ内ではさらに負荷やコンテキスト長、キャッシュの有無で振り分け先を決めているの。GPT-5.6 Sol が Codex を使って本番トラフィックを分析し、見落とされていた偏りを見つけて、新しいルーティング戦略をテスト・調整してくれたんだって。
- **カーネル最適化**：GPT-5.6 Sol は、OpenAI が保守しているオープンソースの GPU プログラミング言語 Triton と Gluon を使って、本番のカーネル（GPU 上で実際に動く計算コード）を自律的に書き換え・最適化したの。この取り組みによって、エンドツーエンドのサービングコストが 20 %も削減されたんだって。正しさを検証するために、オープンソースのツール FpSan（Floating-Point Sanitizer）にも力を入れているよ。
- **投機的デコーディング（speculative decoding）**：小さな「ドラフトモデル」に複数トークンを提案させて、本体モデルがまとめて検証することで逐次計算を減らす手法だよ。GPT-5.6 Sol は、自分自身のドラフトモデルのアーキテクチャを何百通りも実験して改良し、学習プロセスの起動・監視、ハードウェア故障や学習の不安定さへの対応まで自律的にこなしたの。結果、トークン生成の効率が 15 %以上アップしたんだって。
- **KV キャッシュ・設定のチューニング**：バッチング、シャーディング、KV キャッシュの管理は、プロンプトや出力の長さ、バッチサイズ、キャッシュのヒット率などワークロードごとに最適解が変わるの。これまでは設定の組み合わせが多すぎて大まかな経験則に頼るしかなかったんだけど、GPT-5.6 Sol が本番ワークロードを分析して候補構成を生成・評価することで、シナリオごとの細かいチューニングが現実的になったんだって。

### エージェントの土台（agentic harness）の最適化

Codex と ChatGPT Work は、Rust で書かれたオーケストレーション層の上で動いているの。1 回のユーザーのやり取りの中に、モデルへのリクエストやツール呼び出しが何度も挟まるから、その「繰り返し」を減らすことが全体の速さとコストに直結するんだって。

- **コンテキストの膨張を防ぐ**：ツールやスキル、プラグイン、会話履歴が増えるとコンテキストウィンドウも膨らんでコストが増えちゃう。そこで、必要になるまでツールや MCP 連携を表に出さない「deferred discovery」という仕組みを使っているの。ツールの出力も、モデルが別の上限を指定しない限り、デフォルトで 10,000 トークンまでに制限されているよ。
- **プロンプトキャッシュのためのプレフィックス保持**：会話履歴やツールの結果を常に末尾に追加するだけ（append-only）にして、途中に差し込まないようにしているの。ツールの提示順も毎回同じにして、承認ポリシーみたいな実行時の設定は、ツール定義自体には埋め込まずに実行時に適用する。これで同じ内容を何度も GPU に送って計算し直す無駄を避けて、プロンプトキャッシュのヒット率を高く保っているんだって。

## まとめ

- OpenAI が GPT-5.6 モデルファミリー（Sol・Terra・Luna）の効率化の舞台裏を公開したよ。Sol は Coding Agent Index で Claude Fable 5 を上回りつつコスト半分以下、Terra は GPT-5.5 並みの実力を半額で、Luna は Sol より 80 %安いという成果だよ
- カーネル最適化でサービングコストを 20 %削減、投機的デコーディングの改良でトークン生成効率を 15 %以上アップと、推論スタックの隅々まで手が入っているの
- Codex や ChatGPT Work のエージェント基盤も、コンテキストの膨張防止（ツール出力は既定 10,000 トークン上限）とプロンプトキャッシュの工夫で、繰り返し作業のムダを削っているよ
- しかも、これらの最適化の多くは GPT-5.6 Sol 自身が Codex を使って自律的に手がけたものなんだって

API のコストやレイテンシを気にしているエンジニア、そして「AI が自分の基盤を改善する」話にワクワクする人にきっと刺さる記事だよ！
