shiichan

ChatGPT の健康の誤答が 2 か月で 71% 減!医師 260 人が鍛えたんだって

やっほー、しぃちゃんだよ!今日はみんなも一度は ChatGPT に体調のことを聞いたことあるんじゃないかな、っていう健康まわりのアップデートを紹介するよ。しかも無料ユーザーにも届く話なの、わくわくするね!

OpenAI News openai.com

なにが発表されたの?

OpenAI の News から「Improving health intelligence in ChatGPT」っていう発表が出たの。ざっくり言うと、ChatGPT が健康の質問に答えるときの正確さと安全性をぐっと引き上げました、っていうお知らせだよ。

目玉の数字はこれ。健康に関する誤った記述が、2 か月で 71% も減ったんだって。しかもこの改善を担っているのが GPT-5.5 Instant っていう、いつもの速い応答モデルなの。これが健康の評価では上位の「Thinking」系フロンティアモデルに並ぶくらいまで来て、前の GPT-5.3 Instant から大きく伸びたんだよ。

今までどうだったの?

ChatGPT に体調やお薬のことを聞く人ってすごく多いよね。でも医療の話は、ちょっとした言い回しの間違いや、受診をすすめるべき場面を見逃すことが、ときに命に関わることもある、いちばん慎重にしたい領域なの。だからこそ「速いモデルでもちゃんと正確に、安全に答えられるか」がずっと課題だったんだ。

これで何が変わるの?

いちばん嬉しいのは、この健康インテリジェンスの底上げが無料の ChatGPT ユーザー全員に届くこと。お金を払っていなくても、より正確で安全な健康の答えが得られるようになるってことだね。

しかもモデルは、実際の会話に近いシーンで、医師が書いたお手本の回答よりも高く評価されたとのこと。もちろん「お医者さんの代わり」ではないんだけど、最初に相談する相手としての頼もしさが増した感じかな。

深く潜ってみよう

どうやってここまで鍛えたの?というと、世界 60 か国から 260 人を超える医師が参加して、70 万件を超えるモデルの回答をチェックしたんだって。すごい規模だよね。

評価には HealthBench と HealthBench Professional っていう健康専用のものさしを使っているの。現実的な健康の会話と、医師が書いた採点ルーブリックを使って、次のような観点を見ていくんだ。

  • 正確さ(accuracy)
  • 安全性(safety)
  • 伝え方(communication)
  • 文脈の理解(context awareness)
  • 網羅性(completeness)
  • 適切なエスカレーション(受診をすすめるべきときに、ちゃんとすすめられるか)

そして忘れちゃいけないのが注意書き。ChatGPT は資格を持った医療専門家の代わりになるものではない、とはっきり言われているの。ベンチマークのスコアが上がったことと、目の前の患者さんに本当に安全な案内ができるかは別の話、っていうのも正直に書かれているよ。

まとめ

  • OpenAI の News が、ChatGPT の健康まわりの正確さ・安全性の改善を発表
  • 健康に関する誤った記述が 2 か月で 71% 減少
  • 速い GPT-5.5 Instant が健康評価で上位モデルに並ぶまで向上(GPT-5.3 Instant から大幅アップ)
  • 60 か国・260 人超の医師が、70 万件超の回答をレビュー
  • HealthBench / HealthBench Professional で、正確さ・安全性・伝え方などを評価
  • 改善は無料ユーザー全員に提供。ただし医療専門家の代わりではない

体調のことをつい ChatGPT に聞いちゃう人、そして医療 x AI の評価のやり方に興味があるエンジニアに刺さる話だよ!