事件专题 ·多源确认

OpenAI 发布 MentalHealthBench:1215 段对话评估 AI 心理健康应对能力

OpenAI 于 9 月 24 日推出 MentalHealthBench,包含 1215 段合成心理健康对话和 5262 条专家评分标准,由 22 个国家和地区的 80 多名持证心理学家与精神科医生使用 19 种语言制定。测试结果显示 GPT-6 Astra 得分最高为 57.3%,Claude Opus 5.5 为 52.4%,Gemini 2.5 Pro 为 29.5%。数据集覆盖 53.5% 非急性对话、28.3% 紧急对话和 18.2% 高风险对话,OpenAI 将其定位为可审计的诊断工具而非模型排行榜。OpenAI 还对 44 名曾用 AI 获取心理支持的成年人做了独立分析,发现用户与专家评分标准仅 25.7% 达成一致。

当前结论

OpenAI 拿出 1215 段心理对话让各家模型答题,GPT-6 Astra 拿 57.3% 第一,Gemini 2.5 Pro 只有 29.5%,数据集已开放下载。

11 个信源83° AI 热度最后更新 2026/9/24 07:22:21

证据链

11 个信源
相关来源 3Simon Willison’s Weblog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。