# 深夜の CI 障害、Claude が中央値 14 分で一次分析しちゃうよ！

おつかれさま、しぃちゃんだよ！今日は夜中のCI障害をClaudeが真っ先に駆けつけて調べてくれるっていう、エンジニアさんならニヤッとしちゃうニュースを見つけたよ！

## なにが発表されたの？

Claude Blog で、Anthropic 社内の CI/CD 障害対応に Claude を「オンコールの一次対応者」として組み込んだ仕組みが紹介されたよ！社内の Slack ボット「Claude Tag」が、テストの失敗やアラートが上がったときに一番乗りで調査を始めてくれるんだって。

記事では、実際にあった夜間のインシデント例も紹介されてるよ。新しいサービスで 44 件のテストが動かなくなった件を Claude が調べたら、その日の朝に有効化されたフィーチャーフラグが原因だと突き止めて、切り戻して大丈夫と判断。同僚がフラグを戻したあと、Claude は 3 分でスキップルールが消えてエラー率が正常に戻ったことまで確認してくれたんだって。

## 今までどうだったの？

こういうアラート対応って、これまでは人間が夜中でも叩き起こされて、1 時間がかりで原因を調べる…なんてことがザラだったの。CI が壊れるたびに誰かの生活リズムが犠牲になっていたんだよね。

## これで何が変わるの？

Claude Tag が「検知」「トリアージ」「解決」「検証・共有」の一連の流れに入り込むことで、人間はいきなり全部を背負わなくてよくなるよ！

- 検知: 新しいサービスのデータを数日分見て、アラートのしきい値が広すぎ・狭すぎを調整。判断基準（例:「エラー率が 2 パーセントを超える状態が 5 分以上続き、かつデプロイ予定時間外ならページする、それ以外は lessons.md に書く」）も Claude が運用するの
- トリアージ: オーケストレーターエージェントが実行役のサブエージェントを立ち上げて、Grafana・ログストア・PagerDuty・GitHub・Kubernetes・Slack のインシデントチャンネルを MCP Connectors 経由で並行調査。初回のエビデンス付き分析は中央値 14 分、最速では 4 分で根本原因まで特定するんだって
- 解決: フィーチャーフラグの段階的展開の調整、Kubernetes クラスタのドレイン・コルドン判断、人間レビュー向けの PR 作成まで対応
- 検証・共有: 修正の効果を同じツールで確認して、事後分析を lessons.md に記録。ci-weather という別エージェントが、インシデントやビルド状況をまとめて新聞記事っぽいレポートとして全社チャンネルに投稿してくれるの

## 深く潜ってみよう

トリアージの調査は、バグの種類ごとに用意されたマークダウンの「スキル」に沿って進むよ。たとえばシャドウ分岐（shadow divergence）バグ用の調査スキルは 617 行もあるんだって。それだけ細かく手順が言語化されてるってことだね。

lessons.md には、解決したインシデントの経緯・根本原因・修正内容・気づきが書き溜められていて、そこから新しいパターンが見つかると調査スキルに昇格していくの。記事では、設定ファイルだけ見て決めつけてしまった失敗から生まれた教訓も紹介されてたよ。

> query the data first, then theorize. Config tells you what could go wrong; metrics tell you what did.

Claude Tag は人間と一緒に「マルチプレイヤー」で調査に参加できるのもポイント。人間側が仮説を追加したり、逆に Claude が主導したりできるんだって。

導入には Claude Team か Claude Enterprise のプランが必要で、組織オーナーがオンコールの Slack チャンネルに Claude Tag を追加し、GitHub リポジトリや Claude Code Remote と接続するところから始めるみたい。同じ構成を自分のチームでも試せるように、GitHub で「oncall-kit」というテンプレートも公開されてるよ。既存のインシデント履歴からトリアージ用のプレイブックを生成できるんだって。

記事の最後では、こんな数字も紹介されてたよ。

> Our software engineers on average ship 8x as much code per quarter as they did from 2021 to 2025.

コードの出荷量が 8 倍に増えても、PR には必ず人間のオーナーが付き、レビューと CI ゲートは変わらず必須のまま。だからこそ CI 側の対応もエージェント化する必要があった、っていう背景があるんだね。

## まとめ

- Claude Blog で、Claude Tag を CI/CD 障害対応の「オンコール一次対応者」にする仕組みが公開されたよ
- 検知・トリアージ・解決・検証共有の全フェーズに Claude が入り込む設計
- 初回分析は中央値 14 分、最速 4 分で根本原因を特定
- 617 行の調査スキルや lessons.md による学習の蓄積など、地道な仕組みづくりが支えてる
- GitHub の oncall-kit で自分のチームでも同じ構成を試せる

夜間のオンコール対応に疲れてるチームや、エージェントを実運用でどう設計するか気になる開発者さんに刺さる発表だよ！
