# Codex で税務エージェント Tax AI が自分で賢くなる仕組みがすごい！

やっほー、しぃちゃんだよ！今日はね、AI が「自分で自分を直して賢くなっていく」っていう、ちょっとワクワクする話を持ってきたよ。

## なにが発表されたの？

OpenAI の News で、「Building self-improving tax agents with Codex」っていう記事が公開されたの。OpenAI と Thrive Holdings が半年かけて一緒に作った、税務エージェント Tax AI のお話だよ。会計事務所ネットワーク [Crete](https://www.cretepa.com/) の 30 以上の事務所の税理士さんたちのために、どんどん複雑になっていく税務申告書の作成を手伝うエージェントなんだって。

すごいのはね、エンジニアが 1 個ずつ失敗を見つけて直すんじゃなくて、Codex が本番での使われ方を「構造化されたシグナル」に変えて、自分で改善していくところなの。今シーズンのパイロットでは、参加した Crete の事務所で 7,000 件の申告書を処理したんだよ。

## なぜ重要なの？

本番のシステムって、ラボの中とはぜんぜん違う壊れ方をするの。ローンチしてから「あ、ここ変だ」って気づいて、エンジニアが何週間もエッジケースを調べて、プロンプトを直して……っていう手作業のループになりがちだよね。しかも、そのループはエンジニアが動かさないと前に進まないの。

Tax AI がおもしろいのは、この「遅くて手作業なフィードバックループ」を、Codex を中心にした自動ループに置き換えちゃったところ。しかも 3 か月前に最初にデプロイしたバージョンより、今のほうが測定できるレベルで良くなってるんだって。ただ便利になっただけじゃなくて、「勝手に育っていく」のがいちばんのポイントなの。

## これで何が変わるの？

税理士さんは、元になる書類とお客さんのメモをアップロードするだけ。すると Tax AI がレビュー待ちの申告データを作ってくれるの。成果はこんな感じだよ。

- 税務作成にかかる時間をおよそ 3 分の 1 節約
- 下書きの精度は最大 97%
- スループット(こなせる件数)はおよそ 50% アップ

しかも精度の伸び方がすごくて、ローンチ時は「フィールドの 75% が正しく埋まった申告書」が全体の 4 分の 1 しかなかったのに、6 週間で 86% がそのラインに届いたの。最初は W-2 や 1099 みたいな簡単な書類から始めて、シーズンが進むにつれて K-1 やいろんなスケジュール(付表)みたいな難しい申告にも広がっていったんだよ。

記事の中には、去年は税務作業に 180 時間かけていたベテラン会計士さんが、今年は 15 時間で済んだっていうエピソードもあったの。浮いた時間で顧客一人ひとりに電話して申告内容を説明したり、新しいお客さんを増やしたりできたんだって。時間が空くって、こういうことなんだね。

## 深く潜ってみよう

自己改善ループは、3 本の柱でできているの。

1. **税理士さんに寄り添う**: 実際に作業する人が、プロダクトが何を学ぶかを操縦するの。どのエラーが本当に大事かは、現場の人の直感が教えてくれるんだよ。
2. **本番から「証拠」が生まれる作りにする**: 入力と出力だけじゃなくて、元の書類 → 抽出されたフィールドと出典 → 提出と専門家の修正まで、経路まるごとを記録するの。
3. **Codex 主導の改善ループを作る**: 本番の問題が見える化・構造化されたら、それを発見事項 → 専用の eval(評価)→ 範囲を絞ったエンジニアリングタスクに変えて、Codex に調査・修正・検証させるの。

賃貸物件(所得税申告の Schedule E)の例がすごくわかりやすいよ。税理士さんが値を修正すると、その差分が「フィールド単位のレビュー行(期待値・予測値・対応が必要かどうか)」として記録されるの。似た失敗をまとめると、「Tax AI はよく fair-rental-day のフィールドを取りこぼす」みたいなパターンが見えてくる。それを繰り返しの eval ターゲットに変えると、Codex にとっての「登るべき丘」になるんだって。

ここで Codex がすごいのは、ダメな最終出力だけを見るんじゃなくて、トレース・eval・リポジトリ・スキルをまとめて見るところ。パイプラインを調査して、抽出スキーマを広げたりマッパーを直したりして、専用 eval と回帰(リグレッション)テストで検証して、レビュー用のプルリクエストまで出してくれるの。証拠があいまいだったり安全に自動化できない時は、無理に回さずプロダクトチームに差し戻すのも賢いところだよ。

この作り方は、OpenAI が前に書いた [harness engineering](https://openai.com/index/harness-engineering/) と [Symphony](https://openai.com/index/open-source-codex-orchestration-symphony/) の考え方がベースになってるの。タスクを Codex に読みやすくして、範囲を絞ったコンテキストとツールを渡して、検証と人間のレビューを環境の中に残す、っていう発想だよ。自動化するのはあくまで「抽出とマッピング」っていう限られた層で、アーキテクチャや製品判断、リリースの責任はエンジニアが持つ、っていうバランスを大事にしてるんだって。

## まとめ

- Tax AI は OpenAI と Thrive Holdings が作った、Codex で自己改善する税務エージェント。1040 と 1041 の申告書作成を自動化するよ
- 税理士さんの修正 → 本番トレース → Codex 主導の eval ループ、っていう 3 本柱で「勝手に賢くなる」のが心臓部
- 成果は最大 97% の精度、作業時間およそ 3 分の 1 削減、スループットおよそ 50% アップ
- 同じ設計を、経理や監査、IT ヘルプデスクみたいな [Thrive Holdings](https://www.thriveholdings.com/) 内の他ドメインの業務にも広げていく予定なの

自分の現場で「専門家のフィードバックを評価データに変えて、エージェントを継続的に育てたい」って考えているエンジニアや、業務特化の AI エージェントを本気で作りたい人に刺さる内容だよ！
