GPT-4 が登場!司法試験の成績が下位 10 パーセンタイルから上位 10 パーセンタイルまで大躍進!
やっほー、しぃちゃんだよ!今日はテクノロジー好きにはたまらない、大きなニュースを見つけちゃったの。OpenAI から新しい AI モデルが登場したよ、さっそく紹介するね!
OpenAI Newsなにが発表されたの?
OpenAI の News から、新しい大規模言語モデル「GPT-4」が発表されたよ。GPT-4 は幅広い一般知識と問題解決能力のおかげで、難しい問題をより正確に解けるようになったんだって。
それだけじゃなくて、創造性やユーザーとの共同作業もぐっとパワーアップ。作詞や脚本の執筆みたいな創作系のタスクでも、ユーザーと一緒に文章を生成したり編集したりしながら、何度もやり取りして仕上げていけるの。ユーザー自身の文体を学習することもできるんだって。
原文では例として、「シンデレラのあらすじを、A から Z まで順番に始まる単語だけを使って 1 つの文で説明して」というちょっと変わったお題にも、GPT-4 がきちんと応えてみせた様子が紹介されてたよ。
なぜ重要なの?
GPT-4 は、GPT、GPT-2、GPT-3 と続いてきた OpenAI の研究の最新のマイルストーンなんだって。より多くのデータと計算量を使うことで、どんどん洗練されて賢いモデルを作っていく、というディープラーニングのアプローチを引き継いでいるの。
この進化がどれくらいのものか分かるエピソードも原文にあったよ。「アンドリューは 11 時から 15 時まで空いていて、ジョアンヌは正午から 14 時、そして 15 時 30 分から 17 時まで空いている。ハンナは正午から 30 分間、そして 16 時から 18 時まで空いている。3 人で 30 分のミーティングをするなら、いつが候補になる?」という予定調整の問題に対して、GPT-3.5 は 3 人全員が空いていない 16 時を答えとして出してしまったの。一方 GPT-4 は、正しく「12 時から 12 時 30 分」を導き出せたんだって。同じ質問でも、推論の正確さにはっきり差が出た例だね。
これで何が変わるの?
GPT-4 の登場で、いろんな場面がより頼れるものになりそうだよ。
- 予定調整のような、複数の条件を同時に満たす必要がある論理的なタスクでも、より正確な答えを導けるようになったの。
- 作詞や脚本づくりなど創作面でも、ユーザーと何度もやり取りしながら仕上げていけるから、クリエイターの相棒としても頼りになりそう。
- 試験の成績でも大きな伸びが確認されてるよ。統一司法試験(Uniform Bar Exam)では、GPT-3.5 が受験者の中でおよそ 10 パーセンタイル相当だったのに対して、GPT-4 はおよそ 90 パーセンタイル相当まで到達したんだって。
- 生物学オリンピックの問題でも、GPT-3.5 のおよそ 31 パーセンタイルに対して、画像入力にも対応したビジョン版の GPT-4 はおよそ 99 パーセンタイルまで伸びたよ。
これだけの成績アップだから、複雑な指示や込み入った条件を扱うタスクを任せたい人ほど、GPT-4 の実力を実感しやすそうだね。
深く潜ってみよう
GPT-4 は安全性と、原文でいう「アラインメント(alignment、モデルの振る舞いを人間の意図に沿わせること)」の向上にも、6 か月間じっくり時間をかけたんだって。OpenAI の内部評価によると、GPT-3.5 と比べて、許可されていないコンテンツのリクエストに応答してしまう割合が 82% 減って、事実に基づいた回答を返す割合が 40% 増えたそうだよ。
安全面の取り組みとしては、こんなことが紹介されてたよ。
- ChatGPT ユーザーから寄せられたフィードバックも含め、より多くの人間からのフィードバックを取り入れて GPT-4 の振る舞いを改善した。
- AI の安全性やセキュリティといった分野の専門家 50 人以上と協力して、早期にフィードバックをもらった。
- これまでのモデルを実際に使ってもらう中で得た教訓を、GPT-4 の安全性研究や監視の仕組みに反映。ChatGPT と同じように、GPT-4 も利用が広がるのに合わせて定期的にアップデートしていく予定なんだって。
- GPT-4 自身の高い推論力と指示追従能力を、安全性研究にも活用。ファインチューニング用の学習データづくりや、学習・評価・監視で使う分類器の改善にも役立てたそうだよ。
学習環境については、GPT-4 は Microsoft の Azure AI スーパーコンピューターで訓練されたと明記されてるよ。Azure の AI 向けインフラのおかげで、世界中のユーザーに GPT-4 を届けられるようになったんだって。
ただし、社会的なバイアスや事実と異なる内容を生成してしまう「ハルシネーション」、悪意のある入力(敵対的プロンプト)への弱さなど、まだ解決できていない課題も残っているとはっきり書かれてたよ。OpenAI は透明性やユーザー教育、AI リテラシーの普及にも力を入れつつ、モデルの改善に人々の声を反映できる道を広げていきたい、としてるの。
利用方法もシンプルで、GPT-4 は ChatGPT Plus で使えるほか、開発者向けの API としても提供されてるよ。
まとめ
- OpenAI が新しい大規模言語モデル「GPT-4」を発表。幅広い知識と問題解決力で、難しい問題をより正確に解けるようになったよ。
- 予定調整のような論理的な推論タスクで、GPT-3.5 より正確な答えを出せることが具体例つきで示されてるの。
- 統一司法試験は 10 パーセンタイルから 90 パーセンタイル相当へ、生物学オリンピックも 31 パーセンタイルから 99 パーセンタイル相当へと、試験の成績が大きく伸びたよ。
- 安全性向上にも 6 か月間注力。許可されていないコンテンツへの応答が 82% 減、事実に基づく回答が 40% 増(いずれも内部評価)。
- 社会的バイアスやハルシネーション、敵対的プロンプトへの弱さといった課題は、まだ残っているとも明言されてるよ。
- GPT-4 は ChatGPT Plus と API で利用可能。複雑な指示や創作、論理的な条件整理を AI に任せたい開発者・クリエイターに刺さるニュースだよ。