论文Agent 与开发者精选16:35K-Bench:为高风险心理健康对话开发临床校准基准朋友推荐:新开发的K-Bench基准专门用来测试AI在处理高风险心理健康对话时的表现,能帮你了解不同模型在应对自杀、自残等场景时的能力差异。#K-Bench#大语言模型#心理健康#基准测试aarXiv cs.AI@Laura M. Vowels 等 12 人原文稍后读已读值得跟进有用关注 K-Bench