5月24日
5月21日
07:59
07:59Sualeh Asif@sualehasif996
83°
Cursor 宣布与 SpaceXAI 合作,从零开始训练一个显著更大的模型,总计算量是之前的 10 倍。双方将利用 Colossus 2 集群的百万 H100 等效算力,结合各自的数据和训练技术,预计模型能力将有重大飞跃。这一合作表明 AI 编程工具正在向更底层、更强大的基础模型进军,可能带来编程助手能力的质变。
事件专题

推荐理由:Cursor 用户和 AI 编程重度依赖者值得关注——更大模型意味着更智能的代码生成和上下文理解,算力 10 倍提升可能带来体验的质变,建议持续跟踪后续发布。
5月20日
15:58
15:58官方账号arXiv cs.AI@Zijun Jia, Yuanchang Ye, Sen Jia, Yiyao Qian, Haoning Wang, Baojie Chen, Diyin Tang, Jinsong Yu, Zhiyuan Wang
精选
BalanceRAG 提出了一种针对级联检索增强生成(RAG)系统的联合风险校准方法。传统级联RAG会先尝试仅用大模型回答,不确定时再启用RAG,但各阶段独立校准可能过于保守。BalanceRAG 将阈值对视为二维网格上的操作点,通过序贯图形测试识别安全操作点,实现系统级错误率控制。该方法支持多风险校准,能在保证风险水平的同时保留更多样本,减少不必要的检索调用。在多个开放域问答基准测试中,BalanceRAG 在满足预设风险水平的前提下,提高了覆盖率和正确样本接受数。
推荐理由:做RAG系统优化的团队终于有了一个能精确控制风险与检索成本的校准工具——BalanceRAG 用联合阈值替代逐级保守校准,在保证准确率的同时减少不必要的检索调用,建议做问答系统的开发者点开看看。
5月19日
11:46
11:46官方账号阿里云 Alibaba Cloud@alibaba_cloud
72°
阿里云宣布 Qwen3.7-Max-Preview 模型已上线 Arena 平台,在文本任务中排名第6。该模型是 Qwen3.7 系列的预览版本,预计正式版将很快发布。这一进展展示了阿里云在大语言模型领域的持续投入和竞争力提升。
推荐理由:Qwen3.7 系列即将发布,关注国产大模型进展的开发者可以提前了解预览版表现,为后续集成做准备。
10:06
10:06官方账号arXiv cs.AI@Mingyang Rao, Kehua Feng, Zhihui Zhu, Jiangzhen Fu, Hao Yu, Keyan Ding, Huajun Chen
精选
大模型在理解化学反应图方面存在视觉缺陷和语义脱节两大瓶颈。ChemVA框架通过视觉锚点机制和语义对齐方法,将化学结构图转化为模型能理解的实体名称,显著提升理解能力。在OCRD-Bench基准测试中,ChemVA实现92%的结构识别准确率,并在9种不同大模型上平均提升约20个百分点,使开源模型在复杂化学推理任务上媲美闭源系统。
推荐理由:做化学信息学或AI辅助药物研发的团队,终于有了让大模型真正看懂反应图的方法——开源框架可直接用,效果提升明显。
5月13日
10:14
10:14IT之家博客/媒体
精选
苹果发布 Xcode 26.5,增强智能体编程能力。新功能包括编程智能体消息队列,允许开发者连续发送多条消息而无需等待回复,提升协作流畅度。智能体现在可以在任务描述不完整时主动提出澄清问题,避免执行偏差。此外,更新还支持新的 StoreKit Testing 计费方案。

推荐理由:Xcode 26.5 通过消息队列和主动澄清机制,显著提升 AI 编程智能体的交互效率和准确性,对使用苹果生态的开发者有实际帮助。