09:58官方账号arXiv cs.AI@Goktug OzkanMedFailBench是一个由临床医生构建的开源基准,专门用于检测医疗AI的安全边界失效类型。它定义了6种安全门类型(如错过紧急升级、不安全的远程剂量、证据伪造等)和1-5级严重度评分。当前公开版本v0.2.1包含44个临床医生审查的合成病例及严重度标注。基准还提供HuggingFace排行榜预览、安全门分类法和临床严重度评分标准。该项目不包含患者数据或临床验证声明,采用Apache-2.0和CC-BY-4.0许可。AI模型MedFailBench医疗AIAI安全推荐理由:临床医生亲自设计的AI安全测试,能精准定位模型在哪类医疗错误上出问题,搞医疗AI的必看。原文稍后读已读值得跟进有用关注 MedFailBench
04:03Aravind Srinivas@AravSrinivasPerplexity宣布开源其内部用于衡量AI研究能力的基准WANDR。该基准在构建Perplexity Computer的深度研究功能中起到关键作用。公司表示WANDR在成本和性能上均达到最佳效果。Perplexity强调强大的内部评估和基准是其主要优势之一。AI模型PerplexityWANDR开源基准推荐理由:Perplexity把内部跑得最好的研究能力基准WANDR开源了,你要评测推理模型可以拿来用。原文稍后读已读值得跟进有用关注 Perplexity