shiichan

ChatGPT はどうやって暴力を止めるの?OpenAI が安全対策の中身を公開!

やっほー、しぃちゃんだよ!今日はちょっと真剣だけど、みんなに知っておいてほしい大事なお話を持ってきたよ。

OpenAI News openai.com

なにが発表されたの?

OpenAI の News で「Our commitment to community safety(コミュニティの安全への取り組み)」っていう記事が公開されたの。銃乱射や公人への脅迫、爆破未遂みたいな暴力が現実にある世界で、ChatGPT が暴力やそのほかの危害を後押しするために使われないように、OpenAI がどんな取り組みをしているのかをまとめて説明してくれた内容だよ。

柱は 3 つ。「モデルをどう安全に応答させるか」「危害のリスクをどう検知するか」「ポリシー違反があったとき何をするか」を、心理学者・精神科医・市民的自由や法執行の専門家の意見を取り入れながら進めているんだって。

なぜ重要なの?

ChatGPT には、ニュースについて質問する人、怖さや怒りを打ち明ける人、フィクションや歴史や政治として暴力の話をする人……いろんな気持ちを抱えた人がやってくるよね。その中で「純粋な質問」と「本当に危ない計画」を見分けるのは、ものすごく繊細なの。

線引きを間違えると、正当な調べ物までブロックしちゃったり、逆に危ない手助けをしちゃったりする。だからこそ OpenAI は「役に立つこと」と「危害のリスクを最小にすること」のバランスをどう取っているのかを、透明に見せることにしたんだね。

これで何が変わるの?

大きなポイントは、ChatGPT が「長くて緊迫した会話」の中の小さな兆候まで見られるように強化されたこと。1 通のメッセージだけだと無害に見えても、会話全体や複数の会話にまたがったパターンを見ると、もっと心配な流れが見えてくることがあるの。そこを見逃さないようにしたんだって。詳しい中身は数週間のうちにもっと共有してくれるみたい。

それに、これから大人のユーザーが「信頼できる連絡先」を登録できる新機能も入る予定。自分がサポートを必要としているとき、その人に通知が届く仕組みだよ。困っている人が一人で抱え込まないための備えだね。

深く潜ってみよう

まず土台になっているのが Model Spec っていう行動原則。「役立ちとユーザーの自由を最大化しつつ、ちゃんとしたデフォルトで危害のリスクを最小化する」という考え方なの。暴力を実際に後押ししかねない手順・戦術・計画づくりの依頼は断るように学習させつつ、事実・歴史・教育・予防のための中立的な質問には答える。ただし実行に使える細かい操作手順は省く、という線引きだよ。

つらい気持ちや自傷のリスクを抱えた人には、距離を置いて支援につなぐ対応として、地域の相談窓口を案内したり、専門家や信頼できる人に相談するよう促したり、深刻なときは緊急の助けを求めるよう案内するんだって。

ルール違反の監視はこんな流れ。まず Usage Policies で、脅迫・威圧・嫌がらせ・テロや暴力・武器開発・違法行為・システムや財産の破壊・安全策の回避などを禁止事項として明示。そのうえで、分類器(classifier)や推論モデル、ハッシュ照合、ブロックリストといった自動検知システムで、大規模に怪しい兆候を拾い上げるの。

フラグが立った会話は、訓練を受けた担当者が文脈込みで確認するよ。閲覧できる情報は限定されていて、機密保持のルールの中で行われるんだって。自動システムだけだと意図やニュアンスを取りこぼすことがあるから、人の目で判断する段階を挟むんだね。暴力の手助けには「ゼロトレランス(容赦しない)」の姿勢で、違反が確認できたらアカウント停止、同一ユーザーの別アカウントの停止、新規作成のブロックまで踏み込む。決定には異議申し立てもできるよ。

そして、他者に危害が及ぶ差し迫った現実味のあるリスクがあると判断したときは、法執行機関に通報することもある。ここは限られたケースだけを対象に、構造化された基準とメンタルヘルスの専門家の力を借りて慎重に見極めるんだって。

家庭向けには、去年の秋に導入された Parental Controls(保護者向け管理機能) があるよ。保護者のアカウントとティーンのアカウントをひも付けて設定を調整できるけど、保護者が会話の中身を見られるわけじゃないの。急な強い苦痛のサインをシステムと人の確認で検知したごく稀なときだけ、必要な情報にしぼってメール・SMS・プッシュ通知で保護者に知らせる仕組み。若い世代の 安全とプライバシーの両立 を大事にしながら進めているのが伝わってくるね。

まとめ

  • OpenAI が News で、ChatGPT を暴力やほかの危害に使わせないための取り組みをまとめて公開したよ
  • 土台は Model Spec。中立的な質問には答えつつ、実行に使える手順は省く線引き
  • 自動検知(分類器・推論モデル・ハッシュ照合・ブロックリスト)+訓練された人のレビューの二段構え
  • 暴力の手助けにはゼロトレランス。違反ならアカウント停止、差し迫ったリスクなら法執行機関へ通報
  • Parental Controls に加えて、大人向けの「信頼できる連絡先」機能も準備中

AI の安全とポリシーがどう運用されているか気になる人、そして ChatGPT を安心して使いたいみんなに刺さる内容だよ。