shiichan

あなたの会話は学習に使われる?ChatGPT のプライバシー設定と Privacy Filter を整理!

みんな、しぃちゃんだよ!今日は「AI って私たちの会話をどうやって学習に使ってるの?」っていう、ちょっと気になるテーマだよ。プライバシーの話、ちゃんと押さえておきたいよね。

OpenAI News openai.com

なにが発表されたの?

OpenAI の News で、ChatGPT がプライバシーを守りながら世界について学ぶ仕組みを説明した記事が公開されたの。モデルの学習にどんな情報が使われるのか、そこから個人情報をどう減らしているのか、そして自分の会話を学習に使わせるかどうかをユーザーがどうコントロールできるのか、この 3 点をやさしく解説してくれてるよ。

ChatGPT がどんどん賢くなっているのは、複雑で実世界の作業(コーディングや調査、分析、複数ステップのタスク)をこなせるように、いろんなデータで訓練しているから。でもその裏で「個人のプライバシーをどう守るか」もちゃんとセットで考えているよ、というお話なの。

なぜ重要なの?

みんな最近、ChatGPT にけっこう個人的なことを相談したりするよね。人生のセンシティブな部分に触れる質問をすることもあると思うの。OpenAI もそこを「深い責任」と受け止めていて、プライバシー保護を作り込みの中心に置いていると言っているよ。

学習に使うデータの中身と、そこから個人情報を減らす仕組みが公開されると、「自分の会話ってどう扱われてるんだろう?」っていうモヤモヤに答えが出るよね。エンジニアとしても一般ユーザーとしても、知っておいて損はない内容なの。

これで何が変わるの?

いちばん大きいのは、ユーザーが「自分の会話を学習に使わせるかどうか」を自分で選べる、ってことがはっきりしたこと。

設定から Data Controls に進んで「Improve the model for everyone(みんなのためにモデルを改善)」をオフにすれば、新しい会話は履歴には残るけど、ChatGPT の訓練には使われなくなるよ。オンにしている人の会話には、この後で説明する個人情報マスキングもかかるの。

深く潜ってみよう

学習に使われる情報は、公開情報・パートナーシップ経由の情報・ユーザーや委託先や研究者が提供/生成した情報を組み合わせたもの。公開ネット情報については「自由かつオープンにアクセスできるもの」だけを使う、と明記しているよ。たとえば公開の掲示板への書き込みや、公開ブログの投稿なんかが対象になり得るんだって。

個人情報を減らす仕組みの主役が OpenAI Privacy Filter。テキストの中の個人情報を見つけてマスキングするツールで、OpenAI の評価では同種のツールの中でいちばん個人情報の除去が得意、とのこと。これを訓練プロセスの複数段階で、公開データセットにも、「みんなのためにモデルを改善」をオンにしたユーザーの会話にも使っているの。

自分でいじれるコントロールもいくつか紹介されてるよ。

  • 一時チャット(Temporary Chat):新しいチャットで右上の「Temporary」ボタンを押すと開始。履歴に残らず、メモリも作らず、モデル改善にも使われないよ。ただし安全のため 30 日間だけ保持されて、その後削除されるの。
  • メモリ(Memory):大事な人や進行中のプロジェクトなんかを覚えておいてくれる機能。いつでも確認・編集・削除できて、まるごとオフにもできるよ。
  • データのエクスポート、アカウント削除、そしてプライバシーリクエストの窓口からの申請も可能。

あと、深刻な危害のリスクへの対応とプライバシー保護は両立させる必要がある、ともはっきり書いていて、暴力の信頼できる脅威の検知・対応は強化し続けると言っているよ。詳しくはコミュニティの安全と対応の方針のページにまとまってるの。

まとめ

  • 学習データは「公開情報+パートナー経由+ユーザー等が提供・生成した情報」の組み合わせ。公開ネット情報は自由にアクセスできるものだけ
  • 個人情報を減らす主役は OpenAI Privacy Filter。公開データにも、改善オンのユーザー会話にもかける
  • 「Improve the model for everyone」をオフにすれば会話は訓練に使われない
  • 一時チャットは履歴・メモリ・学習に不使用で、安全目的の 30 日保持のあと削除される
  • プライバシーと安全(危害リスクへの対応)は両立させる方針

自分の ChatGPT データがどう扱われるか気になっていた人や、チームでの利用ポリシーを整理したい人にこそ刺さる、整理された解説記事だよ!