# エラー 46% 減！GPT-5.5 が Databricks のエージェントワークフローに登場！

やっほー、しぃちゃんだよ！今日はエンタープライズの現場で動く AI エージェントのお話。わくわくするニュースを持ってきたよ。

## なにが発表されたの？

OpenAI の News からのお知らせ。データ分析基盤で有名な Databricks が、自社の顧客向けエージェントワークフローに GPT-5.5 を投入したんだって！

きっかけは、Databricks 独自のベンチマーク OfficeQA Pro での成績。GPT-5.5 がこのベンチで新しい state of the art（最高スコア）を打ち立てたの。OfficeQA Pro は、スキャンした PDF や古い形式のファイル、長いコンテキストのドキュメントを相手に、モデルがちゃんとパース（読み取り）・検索・根拠のある推論をこなせるかを測るテスト。こういう作業って、本番のエージェントシステムがよく詰まるところなんだよ。

Databricks のリサーチエンジニア Arnav Singhvi さんは、こう言ってるよ。

> "Codex with 5.5 is now state-of-the-art amongst all the agents and models out there."

## 今までどうだったの？

ひとつ前の GPT-5.4 では、けっこう苦戦する場面があったみたい。特に古いドキュメントやスキャン PDF の数字の読み取りで、桁を正しく拾えないことがあったの。

Singhvi さんいわく、いったんある数字や桁を抽出できなくなると、エージェントがその後に扱う内容の流れ（trajectory）がまるごと変わってしまう、とのこと。最初の小さな読み取りミスが、ワークフローの下流にどんどん波及しちゃうんだね。

さらに 5.4 は、マルチステップのタスクで不要な検索の寄り道をして、非効率な進め方になっちゃうこともあったみたい。

## これで何が変わるの？

GPT-5.5 になって、この読み取りまわりが大きく改善したの。エージェントハーネス（エージェントを動かす仕組み）での評価では、GPT-5.5 は GPT-5.4 に比べてエラーを 46% 削減。しかも OfficeQA Pro で初めて正解率 50% を超えた最初のモデルになったんだよ。

Databricks が一番大きな伸びを感じたのは、まさにパース中心のワークフロー。古いドキュメントやスキャン PDF の読み取りで「step-function（階段状の飛躍）」なリフトがあったと表現してるの。加えて、必要なコンテキストを取ってくる信頼性も上がって、追加の手取り足取りなしで複雑なワークフローを最後までやり切れるようになったんだって。

## 深く潜ってみよう

じゃあ本番ではどう組み込まれるの？Databricks は GPT-5.5 を AI Unity Gateway 経由で提供して、顧客は AgentBricks と Agent Supervisor API で組んだワークフローの中でこのモデルを使うんだって。ここでの GPT-5.5 は、パース・検索・実行を、役割を持った複数の専門エージェントにまたがって指揮（オーケストレーション）する司令塔みたいな立ち位置なの。

> "GPT-5.5 has been great in terms of knowledge lift. It's a step size function change in terms of doing knowledge work for us."

知識ワークの底上げって意味で、まさに一段飛びの変化だ、って言ってるね。エージェントを「監督する」役として GPT-5.5 を据えるのが、これからのカスタムエージェントの形になりそう。

## まとめ

- Databricks が GPT-5.5 を顧客向けエージェントワークフローに投入（OpenAI の News）
- 自社ベンチ OfficeQA Pro で、GPT-5.4 比エラー 46% 減・初の正解率 50% 超え
- 特に古いドキュメントやスキャン PDF のパースで大きく改善
- 提供は AI Unity Gateway 経由、AgentBricks と Agent Supervisor API のワークフローで GPT-5.5 が司令塔に

エンタープライズで「書類まみれの業務を自動化するエージェント」を作りたい人、そして GPT-5.5 が実際の現場でどれだけ効くのか気になる人に刺さる話だったよ！
