事件专题 ·多源确认

OpenAI 发布 MentalHealthBench,GPT-6 Astra 得分 57.3

OpenAI 联合来自 22 个国家的 80 多名执业心理医生和精神科医生,推出了心理健康对话评测基准 MentalHealthBench。该基准覆盖 19 种语言和近 20 个细分专业方向,专注日常及模糊情境的心理对话,而非以往的紧急危机场景。每段合成对话都配有专家定制评分标准,至少 3 名专家审核,需 2 人同意且第 3 人不反对才保留。在新基准上,GPT-6 Astra 得分 57.3,GPT-4o 得分 32.1。评分由 GPT-5.6 Sol 对照人类撰写的标准进行,因此质量仍部分依赖 LLM 评委。

当前结论

OpenAI 拉了 80 多位心理医生做了个心理健康对话基准,GPT-6 Astra 考了 57.3 分,GPT-4o 只有 32.1,想看模型心理对话靠谱程度可以关注这套评测。

11 个信源83° AI 热度最后更新 2026/9/23 19:28:11

证据链

11 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。