# 選挙と AI にどう向き合う？ Anthropic が Claude の中立性を数字で公開！

やっほー、しぃちゃんだよ！選挙と AI って聞くとちょっと身構えちゃうけど、今日のニュースはそこにきちんと向き合った話だから、わくわくしながら読んでいくね。

## なにが発表されたの？

Anthropic の News から、「選挙セーフガードのアップデート」が届いたよ。今年のアメリカ中間選挙をはじめ、世界中の大きな選挙を前に、Claude が選挙の情報を正確で公平に届けられるよう、どんな仕組みを整えているかをまとめた記事なの。

政治の話題、候補者のこと、いつ・どこで・どうやって投票するか…そういう質問に AI がちゃんと答えられれば、民主主義にとってプラスの力になれる、っていう考えが土台になっているんだって。

## 今までどうだったの？

Anthropic はこのテーマに前から取り組んでいて、政治的な公平さについては[前回の記事](https://www.anthropic.com/news/political-even-handedness)でも詳しく書いていたの。選挙まわりのリスクをどうテストするかも、じつは [2024 年から](https://www.anthropic.com/news/testing-and-mitigating-elections-related-risks)手をつけていた話なんだよ。

今回はその取り組みを最新モデル向けにアップデートして、しかも数字つきで公開したのがポイントなんだ。

## これで何が変わるの？

一番うれしいのは、「Claude が政治の話でどれくらい中立か」を、ふわっとした約束じゃなくて具体的な数字で見せてくれるところ。評価の方法とデータセットも[オープンソースで公開](https://www.anthropic.com/news/political-even-handedness)しているから、第三者が同じ検証を再現したり、もっと良くしたりできるの。

使う人にとっては「なんとなく信じてね」じゃなくて、確かめられる安心につながるんだよ。

## 深く潜ってみよう

中身をもう少し見ていくね。政治的な中立さは、[Claude の憲法](https://www.anthropic.com/constitution)に書かれた「異なる政治的立場を同じ深さ・熱量・分析の厳密さで扱う」という原則がベースになってる。これをキャラクター訓練でモデルに身につけさせて、システムプロンプトで毎回の会話に念押ししているんだって。左右どちらの立場のプロンプトにも同じくらい丁寧に向き合えるかを測る評価では、Opus 4.7 が 95%、Sonnet 4.6 が 96% だったよ。

ルール面では、[利用ポリシー](https://www.anthropic.com/legal/aup)が欺瞞的な政治キャンペーン、偽の政治コンテンツ、有権者への詐欺、投票システムへの干渉、投票に関する誤情報を禁止しているの。違反の兆候は自動の[分類器](https://www.anthropic.com/research/next-generation-constitutional-classifiers)で検知して、専門の脅威インテリジェンスチームが調査・対処する二段構えなんだ。

実力テストもすごく具体的で、600 個のプロンプト(有害な依頼 300 + 正当な依頼 300)を使って、Opus 4.7 は 100%、Sonnet 4.6 は 99.8% 適切に対応できたそう。多ターンで影響工作(influence operation)をまねたテストでは、Sonnet 4.6 が 90%、Opus 4.7 が 94% だったよ。さらに今回はじめて「モデルが影響工作を自律的に丸ごと計画・実行できるか」も試したんだけど、セーフガードを外した素の状態だと Mythos Preview と Opus 4.7 は半分以上のタスクをこなしちゃったの。だから油断は禁物、って自分たちで釘を刺しているんだ。数字の詳細は[評価レポート](https://cdn.sanity.io/files/4zrzovbb/website/037f06850df7fbe871e206dad004c3db5fd50340.pdf)にまとまっているよ。

情報源の案内も強化されていて、投票登録や投票所を聞くと出る「選挙バナー」は、今年のアメリカ中間選挙では [Democracy Works](https://www.democracy.works/) が運営する非党派サービス TurboVote に案内するの。ブラジルの選挙にも同じ仕組みを入れる予定なんだって。あと、知識のカットオフを補うために web 検索も評価していて、中間選挙関連の質問では Opus 4.7 が 92%、Sonnet 4.6 が 95% の割合で検索を発動したよ。

## まとめ

- Anthropic が、選挙前に Claude の中立性・安全性をどう担保しているかを数字つきで公開
- 中立性評価は Opus 4.7 が 95%、Sonnet 4.6 が 96%。方法とデータセットはオープンソース
- 600 プロンプトへの適切対応は Opus 4.7 が 100%、Sonnet 4.6 が 99.8%。影響工作テストは 90〜94%
- セーフガードを外すと自律的な工作タスクを半分以上こなせてしまい、継続的な警戒が必要
- 選挙バナーは TurboVote へ案内し、web 検索の発動率も 9 割超

AI の安全性や評価設計に関心があるみんな、そして「選挙と AI の付き合い方」が気になっている人にこそ読んでほしい一本だよ。
