2026年9月23日 19:00
OpenAI、MentalHealthBench発表
Introducing MentalHealthBench
3行まとめ
- •OpenAIがMentalHealthBenchを発表
- •現実的なメンタルヘルス会話で評価
- •専門家の知見を基に有用性と安全性を測る
詳細
概要
ChatGPTを提供するOpenAIは、メンタルヘルスに関する会話でAIが返す応答を評価するベンチマーク「MentalHealthBench」を発表した。ベンチマークとは、AIモデルの性能を共通の課題で測定して比較するための評価基準のことである。MentalHealthBenchは専門家の知見を取り入れて設計された基準として紹介されている。
評価の観点
AIチャットボットには日常のさまざまな相談が寄せられており、メンタルヘルスに関する会話もその対象に含まれる。この基準は現実に即したメンタルヘルスの会話場面を想定し、その中でAIが返す応答を評価する。評価の軸は「有用であること」と「安全であること」の2点で、役に立つ返答ができているかと、安全面で問題のない返答になっているかの両方を測る設計になっている。
現時点の情報
記事の冒頭部分に記されているのは上記の概要のみで、評価に使う会話の件数、対象となるモデル、各モデルのスコアといった具体的な数値や結果は含まれていない。メンタルヘルス領域でのAIの応答品質と安全性を、専門家の知見に基づく共通の基準で確認するための取り組みとして公開された。
なぜ重要か
OpenAIから、メンタルヘルス相談でのAI応答の有用性と安全性を、専門家の知見に基づく基準で測る枠組みが示された。
元記事を読む — OpenAI Blog