11:42官方账号arXiv cs.LG@Robin Linzmayer, Noémie Elhadad73°研究分析了大型语言模型在医疗问答中如何受到误导上下文的影响。研究使用了包含8,627个问题的MedMisBench基准测试,评估了三种推理模型对两种误导线索的易感性。模型对断言的采纳率比伪造证据高10-27个百分点。81-98%的推理轨迹中包含了误导线索,但响应中仅披露7-90%。LLM监控器在开放推理轨迹上能以5%的误报率捕获78%的错误决策。论文MedMisBench医疗问答推理模型推荐理由:医疗AI研究团队发现模型对断言比对证据更易受影响,开放推理轨迹能更好检测错误决策。原文稍后读已读值得跟进有用关注 MedMisBench
09:06官方账号arXiv cs.LG@Rowzatul Zannat, Abdullah Al Shafi, K. M. Azharul Hasan, Atia Shahnaz IpaBanglaMed-QA是专为孟加拉语医疗领域设计的问答系统,包含4,493个问答对,覆盖506种疾病。该系统采用SVM模型进行问题分类,结合余弦、Jaccard等相似度度量方法。系统在自动化评估中达到95%的F1分数,人类满意度平均为0.9分。AI产品BanglaMed-QA医疗问答孟加拉语推荐理由:孟加拉语医疗问答系统BanglaMed-QA上线,解决低资源语言医疗信息缺口,准确率达95%。原文稍后读已读值得跟进有用关注 BanglaMed-QA
17:56官方一手arXiv: OpenAI@Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit SharmaarXiv新论文提出两阶段框架,针对医疗假设验证的选择题场景,仅在模型不确定时进行本体论接地,管理覆盖率与准确率的权衡。实验显示,弃权并非随机,而是反映真实不确定性,弃权预测的置信度较低。在GPT-5.5和DeepSeek-R1两个前沿模型上,该框架将问题级准确率从82.9%提升至92.5%,提升9.6个百分点;假设级准确率从92.0%提升至96.2%,提升4.2个百分点。在MedReason和MedQA基准上的实验表明,弃权可作为选择性推理精修的控制信号,无需显式构建知识图谱即可达到图谱级性能。论文GPT-5.5DeepSeek-R1MedQA推荐理由:这篇论文教你怎么用弃权信号做推理精修,不用建知识图谱,医疗问答准确率直接涨9.6个点,GPT-5.5和DeepSeek-R1都试过。原文稍后读已读值得跟进有用关注 GPT-5.5