OpenAI 的 MentalHealthBench 在心理健康对话方面对 GPT-6 Astra 的评分为 57.3
核心要点
- OpenAI 与 80 多名心理健康专家建立了严格的新基准,以测试 AI 处理敏感对话的能力,其最新模型处于领先地位 心理健康对话是一个人可以进行的最重要的互动之一。
- OpenAI 于 2026 年 9 月 23 日发布了 MentalHealthBench,这是一个开放基准,旨在评估 AI 模型在现

OpenAI 与 80 多名心理健康专家建立了严格的新基准,以测试 AI 处理敏感对话的能力,其最新模型处于领先地位
心理健康对话是一个人可以进行的最重要的互动之一。 OpenAI 现在已经为这个问题建立了一个正式的衡量标准,并且其最新模型是第一个对其进行测试的模型。
OpenAI 于 2026 年 9 月 23 日发布了 MentalHealthBench,这是一个开放基准,旨在评估 AI 模型在现实心理健康对话中的表现。该公司最新的旗舰型号 GPT-6 Astra 在基准测试中得分为 57.3,领先于其前身 GPT-4o。
Gloria Stocks 在一个应用程序中,加密货币在另一个应用程序中,钱包无处不在?凯莱金融将您的整个投资组合一目了然。一起看看→
MentalHealthBench 实际衡量的是什么
OpenAI 与 22 个国家的 80 多名有执照的心理健康专业人士合作开发了该基准。对于每个评估的响应,评分标准的加权范围为 -1 到 +10。分数由四个主要标准决定:安全性、上下文相关性、用户代理的保留以及提供可行指导的能力。引导用户进行有害行为的响应可能会得分为负;正确识别紧急情况并提供适当升级路径的响应得分接近最高。
该基准评估跨不同用户角色的人工智能,而不是将所有用户视为可互换的。测试的角色包括成年人、13 至 17 岁的青少年、护理人员和临床医生。
评估中使用的合成对话是为了反映真实的 ChatGPT 使用模式而构建的。 OpenAI 公开发布了基准测试的方法和合成数据,使独立研究人员能够进行自己的评估并对 OpenAI 的研究结果提出质疑。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
GPT-6 Astra 的上下文得分
GPT-6 Astra 于 2026 年 9 月 3 日推出,大约比基准公开发布前三周。
美国心理学会首席执行官阿瑟·埃文斯博士指出了解决从日常情感支持到紧急危机干预等全方位心理健康需求的重要性。
为什么这个基准测试比 OpenAI 更重要
到目前为止,还没有广泛接受的、经过专家验证的标准来评估心理健康领域的人工智能。其他人工智能开发商,包括 Anthropic、Google DeepMind 和 Meta,现在可以根据相同的标准运行自己的模型并发布可比较的结果。学者、临床医生和政策研究人员还可以使用公开发布的方法和合成数据来开展有关人工智能和心理健康安全的独立工作。
