行业新闻

OpenAI 发布 MentalHealthBench,评估 AI 在心理健康对话中的表现

心理健康场景是 AI 出错代价最高的领域之一,这个基准给「有用又不伤人」提供了可量化的评分标准。

OpenAI 推出 MentalHealthBench,一个由领域专家参与设计的评测基准,用来衡量 AI 在真实心理健康对话中是否既有帮助又足够安全。它把「有同理心的回应」和「不造成伤害」拆成可打分的维度,让不同模型在同一套标准下比较。

正文摘录

MentalHealthBench 是一个由专家参与设计的 benchmark(基准测试),用于评估 AI 在贴近真实的心理健康对话场景中,所给出的回复是否既有帮助、又足够安全。

阅读原文(openai.com)→

行业新闻2026-09-23原文

相关内容