8月7日
07:46
07:46官方账号Greg Brockman@gdb
Ethan Bloch在GPT-5.2上开展的个人财务AI实验获得良好结果。OpenAI的个人财务基准曾显示,从5.3到5.5版本有巨大提升,该实验如果今天运行成绩会更好。目前模型已推进到5.6,作者称虽无外部基准,但性能更优。
事件专题

推荐理由:OpenAI的人说GPT-5.6在个人财务上更强了,还有5.2的实验结果和5.3到5.5的基准对比,想了解AI理财能力的可以看。
7月28日
12:30
12:30官方账号arXiv cs.AI@Hangjie Yuan, Yichen Qian, Zhiwei Tang, Xianzhe Xu, Lirong Wu, Sicheng Yang, Jinwang Wang, Pengju Wang, Zhitao Zeng, Yizeng Han, Yan Xing, Shengxuan Luo, Tao Feng, Qing Xie, Weigen Yao, Yi Yang, Zuozhu Liu, Jiasheng Tang, Shaocheng Wang, Jitao Wang, Jiahong Dong, Weihua Chen, Feng Xu, Fan Wang
ClinFusion提出组合级联视觉编码器架构Cascade Spatial-Aware Locality Fusion,统一2D和3D医学图像理解。引入MedIF-Bench进行指令跟随评估,并采用基于感兴趣区域的方法实现临床对齐的事实性报告生成评估。在24项基准中,ClinFusion以20项超越开源医学MLLM如Hulu-Med和Lingshu,并在13项上超过GPT-5.2和Gemini-3-Flash。放射科医生盲评确认ClinFusion生成最高排名报告,且其ROI基础指标与专家判断相关性最强。
推荐理由:ClinFusion用新架构统一2D/3D医学图像,在20/24基准上碾压Hulu-Med、Lingshu,甚至超GPT-5.2。医生盲评说它报告最好,值得关注。
7月7日
12:09
12:09官方一手arXiv: OpenAI@Nicole Sonne Heckmann, Arnault-Quentin Vermillet, Søren Norlin Mølgaard, Manuela Del Castillo Suero, Lars Melskens, Gerard Ompad, Maurizio Sessa
该研究开发了一种高斯过程兼容的优化目标(EWACS),用于提升LLM在药物警戒因果关系评估中的表现。在723份FAERS病例上,GPT-5.2在Naranjo算法问题5和10上分别达到74.1%和65.4%的专家一致性。贝叶斯优化后,因果分类一致性从45.0%提升至72.0%,其中Doubtful病例提升最大(+42.9个百分点)。结果表明,温度优化虽无普遍最优值,但可针对特定病例带来显著改善。
推荐理由:这篇论文用GPT-5.2做药物副作用评估,温度调优后准确率从45%跳到72%,对药物安全分析很有参考价值。
5月22日
02:27
02:27Ethan Mollick@emollick
一项研究显示,GPT-5.2 在同行评审中达到专家水平。45 位科学家花费 469 小时,对 82 篇论文的人类和 AI 评审进行了评估。结果发现,当前 AI 评审者甚至能与 Nature 官方顶级评审员竞争,尽管仍存在弱点。这表明 AI 在学术评审领域有巨大潜力,可能改变科研出版流程。

推荐理由:科研人员和学术编辑终于有了高效的评审助手——GPT-5.2 的评审质量已接近 Nature 顶级评审员,做论文审稿或投稿的团队值得关注这项进展。
5月14日
16:33
16:33官方账号百川智能 Baichuan@BaichuanAI
百川智能正式开源了新一代医疗大模型Baichuan-M3,该模型在HealthBench上取得65.1分,并在HealthBench Hard上以44.4分夺冠。在医疗领域,Baichuan-M3全面超越了GPT-5.2。这一开源举措将推动医疗AI的普及和进步,为医疗行业开发者提供强大的工具。

推荐理由:医疗AI开发者终于有了开源且超越GPT-5.2的模型——Baichuan-M3在HealthBench上夺冠,做医疗诊断或健康咨询的团队可以直接拿来用,建议点开看看具体性能。