OpenAI:MentalHealthBench 開源——逾八十臨床專家標註、千二百一十五則對話評測心理健康能力

Key takeaway

OpenAI 於二零二六年九月二十三日公開發佈 MentalHealthBench:一套以現實心理健康對話為對象的開源評測基準,含一千二百一十五則合成對話,並由逾八十名持牌精神健康專業人員撰寫與裁定評分標準。官方論文指出,現有基準多聚焦緊急危機,難以反映日常情緒支援到高風險緊急之間的完整光譜;新基準同時納入青少年、照顧者與臨床人員等用戶畫像,以及多語與跨文化情境。來源真實性已驗證:一級來源為 OpenAI 官方論文 PDF 與數據集下載頁,並以 OpenAI 官方社交帳號同日帖文交叉核對。

OpenAI:MentalHealthBench 開源——逾八十臨床專家標註、千二百一十五則對話評測心理健康能力

OpenAI 於二零二六年九月二十三日公開發佈 MentalHealthBench:一套以現實心理健康對話為對象的開源評測基準,含一千二百一十五則合成對話,並由逾八十名持牌精神健康專業人員撰寫與裁定評分標準。官方論文指出,現有基準多聚焦緊急危機,難以反映日常情緒支援到高風險緊急之間的完整光譜;新基準同時納入青少年、照顧者與臨床人員等用戶畫像,以及多語與跨文化情境。來源真實性已驗證:一級來源為 OpenAI 官方論文 PDF 與數據集下載頁,並以 OpenAI 官方社交帳號同日帖文交叉核對。

本文整理其數據構成、十項行為軸與公開基線成績,以及對企業部署對話式 AI、私有模型與香港/亞洲合規場景的啟示。所有數字與模型名次均以官方文稿為準,不臆造未公開的產品定價或內部事故統計。

OpenAI:MentalHealthBench 開源——逾八十臨床專家標註、千二百一十五則對話評測心理健康能力

一、核心事件:把心理健康對話評測從「危機開關」擴成全光譜

技術細節

OpenAI 在論文《MentalHealthBench: An Expert-Informed Benchmark of AI Capabilities in Realistic Mental Health Conversations》中寫道:ChatGPT 等系統每週接觸逾十億人,情緒支援、人生建議與危機求助等高利害場景日增,但外界對模型在「整段嚴重度光譜」上是否安全、有幫助,仍缺乏可審計量尺。多數既有基準偏重自傷/自殺等緊急情境;真實使用卻大量落在日常關係困擾、焦慮、藥物疑惑與照顧者提問等非緊急但足以影響求助決策的對話。

MentalHealthBench 因此設計為:

  • 規模:一千二百一十五則合成對話前綴(conversation prefix),每則以用戶回合結尾,評測模型對最後一輪的回覆;並公開五千二百六十二條專家撰寫的評分準則(rubric criteria)。
  • 嚴重度分佈(文稿標示):非急性約百分之五十三點五、高嚴重度約百分之十八點二、緊急約百分之二十八點三。
  • 用戶畫像:成年約百分之六十八點一、青少年約百分之二十一點二、臨床人員約百分之五點八、照顧者約百分之四點九。
  • 專家網絡:逾八十名持牌精神科醫生與臨床心理學家,涵蓋逾二十個國家、十九種語言、近二十個亞專科;兩名專家獨立撰寫準則後,由第三名裁定。約三十名具十八歲以下處遇經驗的臨床人員負責青少年題組。
  • 用戶視角:另召集逾四十名成年真實用戶(十六國、十四語),僅標註非急性題,避免非臨床人員接觸高風險內容;官方結論為用戶信號「連貫且互補」,但「不可與專家臨床/安全指引互換」。
  • 開源釋出:數據集見 https://cdn.openai.com/ctf-cdn/OAI_MentalHealthBench.zip;論文 PDF 置於 OpenAI CDN。官方要求勿以純文字或圖像把題目大量公開上網,以免污染訓練語料,並附 canary 字串供排除。

評分採「LLM as judge」:以 GPT-5.6 Sol(高推理力度)對每條準則做是否滿足的二元判定;每題抽四次回覆再平均。分數同時報告 task-clipped(下限為零)與 signed score(可因負向準則扣分)。公開基線中,task-clipped 領先者為 GPT-6 Astra 約百分之五十七點三、GPT-6 Sol 約百分之五十三點九、Claude Opus 5.5 約百分之五十二點四;文稿並強調模型在「主動蒐集必要脈絡」與「急迫度校準」上仍有明顯落差。

OpenAI 官方社交帳號同日強調:多數心理健康基準只看緊急情況,MentalHealthBench 則覆蓋人們實際帶給 AI 的完整光譜,並開源供其他研究者檢視。

二、技術原理深度解析

合成對話,不是把真實病歷公開。 官方以類似 Clio 的隱私保護方法,先抽出真實 ChatGPT 心理健康使用的高層模式,再以 LLM 用戶模擬器生成對應場景與書寫風格。目標是外部效度(像真),同時避免直接釋出敏感對話。

準則導向,而非單一「安全/不安全」標籤。 每則對話有專屬加權準則(約 −10 至 +10),把「該問什麼、不該假設什麼、何時轉介真人/危機資源」寫成可獨立評分的行為項。這比二元標籤更能區分「技術上安全但空泛」與「過度警報或錯失風險」等失敗模式。

十項行為軸。 準則映射到十個互斥軸,包括:可執行指引、臨床準確、協作與用戶自主、溝通寫作、脈絡蒐集/評估、雙用途拒絕與傷害迴避、同理與情緒對準、詮釋/認知重構、急迫度校準、現實檢驗。軸分解可解釋為何總分相近的模型,在「問對問題」與「勿把日常困擾當急診」上差異很大。

急迫度是雙向張力。 文稿以 emergent 與 non-acute 的急迫度準則通過率畫出 frontier:右上角才是「緊急時夠警覺、非緊急時不過度升級」。OpenAI 自陳目前偏保守以保緊急安全,並持續改善平衡。

與 HealthBench 系譜銜接、但對象不同。 HealthBench 偏醫療健康對話;MentalHealthBench 專攻心理健康與福祉光譜,並刻意把「擬人化 AI 陪伴」部分排除在範圍外。讀者勿把兩套分數直接橫比。

三、代幣經濟學/協議層影響

本事件屬 AI 安全與評測研究發布,不涉及鏈上代幣或協議供應。本節從略。

四、日常應用場景

1. 開發者與技術團隊

若產品內建情緒支援、客服升級為「會聊心事」的代理,或對外宣稱通過某類安全評測,MentalHealthBench 提供可複現的公開量尺:可對自家模型跑同一千二百一十五題、對照十軸弱項,再決定要補強提示、工具(危機資源路由)還是拒絕策略。開源 zip 與 canary 機制也提醒:勿把題目灌進訓練集。

2. 企業與隱私敏感行業

銀行、保險、醫療與教育若允許員工或客戶用對話式 AI 處理壓力/焦慮相關提問,需面對「模型何時該轉介真人」的治理問題。公開基準有助採購與風控把「心理健康行為」寫進驗收,而不是只看通用紅隊。敏感對話本身仍應優先考慮數據不出境的私有部署與審核日誌。

3. 一般用戶

基準是給研究者與開發者的診斷工具,不是醫療建議,也不能替代持牌專業人員。官方亦重申:模型應在適當時引導用戶尋求親友、臨床人員與危機服務,而非自居治療替代品。

4. 香港與亞洲市場視角

香港中小企業與外包團隊正把客服、HR 與內部知識庫接上 LLM;粵語/書面語混用、跨代照顧者提問、跨境員工心理健康資源差異,都會放大「急迫度誤判」與「空泛安慰」成本。MentalHealthBench 雖含多語子集,官方也承認語言與文化效應尚未完全分離——亞洲團隊若要落地,仍應另做在地臨床顧問審閱與私有回歸集。對受《私隱條例》與行業指引約束的機構,把敏感對話留在境內私有 API,比把員工心事送上公有雲更易交代。

五、專業評價與潛在考量

優勢

  • 一級來源完整:論文、數據集與官方社交發佈可交叉核對。
  • 從危機導向擴到全光譜,較貼近真實產品用量。
  • 專家裁定加上用戶互補分析,讓「誰的價值觀進評測」變得可討論,而非隱含單一偏好。
  • 行為軸與急迫度 frontier 提供可行動的工程診斷,而不只是總分排行榜。

需要留意的地方

  • 合成對話再逼真,仍非真實臨床試驗;不能直接宣稱「可替代治療」。
  • LLM judge 本身引入方差;跨廠商比較時需固定抽樣與評分設定。
  • 用戶準則與專家準則存在張力,官方警告不可天真合併。
  • 公開基線反映特定 API 預設;產品層的年齡預測、Trusted Contact 等防護需另查產品公告,不宜由本基準分數外推。

結語

當對話式 AI 已走進情緒支援與危機邊緣,業界需要的不只是「會不會拒答」,而是可審計、可分解的行為量尺。OpenAI 以 MentalHealthBench 把逾八十名臨床專家的判斷,轉成一千二百一十五則可開源複現的題組,並坦承脈絡蒐集與急迫度校準仍是弱項——對正把 LLM 接進客服與內部助手的香港企業,這是採購與治理的參考座標,而非一張「已安全」證明書。

若貴司需要在香港部署數據不出境的企業私有 LLM(數據集建構、QLoRA/LoRA 微調至私有 API,年費由港幣八萬八千元起),可參考 YSK Limited:https://ysk.hk/services/ai-automation 。查詢:WhatsApp +852 6160 4242/[email protected]


參考來源

  1. OpenAI 官方論文 PDF:MentalHealthBench(含方法、基線與數據說明)— https://cdn.openai.com/ctf-cdn/MentalHealthBench_A_Comprehensive_Benchmark_of_AI_Capabilities_in_Realistic_Mental_Health_Conversations.pdf
  2. OpenAI MentalHealthBench 數據集 — https://cdn.openai.com/ctf-cdn/OAI_MentalHealthBench.zip
  3. OpenAI 官方發現帖文(MentalHealthBench 發佈)— https://x.com/OpenAI/status/2102837574092161102
  4. OpenAI 官方跟進帖文(基準覆蓋完整光譜)— https://x.com/OpenAI/status/2102837575568519450

Related services & products