9月3日
11:49
11:49官方一手arXiv: DeepSeek@Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Zicheng Li, Xuanqi Peng, Fei Teng, Jiacong Mi, Honghan Wu
精选73°
该研究提出了一种行为融合模型,结合大语言模型和本体排序器进行罕见病诊断。在Phenopacket Store和RAMEDIS数据集上,融合方法将Phenomizer Recall@1分别提升7.86和20.18个百分点。当与DeepSeek-V4-Flash API结合时,融合模型将Recall@1从0.1657提升至0.2176,提升5.19个百分点,无需重新训练。90.8%的正确融合诊断保留了可检查的本体证据。
事件专题

推荐理由:研究将LLM与本体排序器融合,提升罕见病诊断准确率,同时保留可追溯的证据链。
9月2日
10:07
09:39
09:39官方账号arXiv cs.AI@Chao Gao, Haijiang Liu, Qiyuan Li, Caicai Guo, Frank van Harmelen, Jinguang Gu
研究显示大语言模型在面对支持导向和消除导向两种表述方式的多选题时,回答常不一致。研究者引入双框架协议,通过最小变化的提示词保持评估目标固定。研究发现两种框架在中间层诱导出可分离的[STATE]激活。交换这些激活能系统性地改变预测结果,提高跨框架一致性。
推荐理由:这篇论文揭示了大模型在多选题中不一致回答的内部机制,通过StateSwap技术证明了不同表述方式会激活不同内部状态。
05:13
9月1日
11:25
09:25
09:25官方账号arXiv cs.LG@Jieying Xue, Phuong Minh Nguyen, Minh Le Nguyen, Shogo Okada
精选73°
该研究探索了功能向量(FVs)在多语言多标签情感识别任务中的跨语言迁移能力。研究显示,从源语言提取的功能向量能在零样本设置中显著提升目标语言性能,无需推理时提供演示。每个大语言模型在构建有效功能向量时表现出相对稳定的最佳注意力头范围,且这一模式在不同语言中保持一致。
推荐理由:论文发现功能向量能跨语言传递任务信号,无需演示即可提升多语言情感识别性能,比少样本学习更高效。
8月31日
09:32
09:32官方账号arXiv cs.AI@Hefan Zhang, Bingquan Zhang, Ming Cheng, Saeed Hassanpour, Weicheng Ma, Soroush Vosoughi
精选
研究分析了8个分类任务、2个生成任务和30个模型的语言自信与内部自信差异。分类任务中,语言自信与基于logits的自信在关联性、幅度一致性和校准性三个维度上经常不一致。生成任务中,语言自信无法有效跟踪基于语义熵的不确定性。指令微调模型通常报告更高自信,但自信差距更大且校准更差。
推荐理由:8个分类任务+30个模型研究显示,LLM说的自信程度和实际内部自信经常不一致
09:06
09:06官方账号arXiv cs.LG@Niccolò Ajroldi, Diana Alexandra Onutu, Haider Al-Tahan, Jörg Franke, Sampo Pyysalo, Jenia Jitsev, Aaron Klein
73°
该研究分析了英语语料上预训练密集大语言模型的学习率和批量大小缩放行为。研究开发了捕捉学习率和批量大小与模型容量和数据规模关系的模型。研究评估了最近提出的缩放形式,发现它们能有效捕捉实验中的欠训练和过训练状态。研究建立了OpenEuroLLM模型开发的基准和缩放程序。
推荐理由:OpenEuroLLM团队开源了预训练研究,揭示了学习率和批量大小如何随模型和数据规模变化。
8月27日
11:02
11:02官方账号arXiv cs.LG@Xiaodong Wu, Wenyi Yu, Chao Zhang, Philip Woodland
精选
研究通过Transformer损失景观的谱探针分析,解释了为什么Muon比Adam在大语言模型预训练中表现更好。提出Spectral-Aware Muon (SAMuon)改进方案,通过静态谱先验放大bulk部分,在124M到1B参数的模型上优于AdamW和Muon基准。SAMuon需要更少的训练token达到相同验证损失。
推荐理由:这篇论文揭示了为什么Muon优于Adam,并提出了改进方案SAMuon,值得AI模型研究者关注。
8月24日
09:38
09:38SuperTechFans博客/媒体
精选
本地大语言模型因推理栈差异导致数学一致性破坏,感觉比实际更笨。匹兹堡拾荒文化展现废金属回收便利性。成为优秀作家需大量阅读。Python编程基础书籍发布。hdiutil在macOS 27中被弃用。Qwen 3.8 27B模型逆向工程商业应用许可证检查。Wi-Fi 8转向提升网络可靠性。MartyPC早期PC模拟器注重准确性。AMD Athlon XP处理器易损坏。NetBSD稳定性改善工作与生活平衡。
推荐理由:了解本地大语言模型表现差异,匹兹堡拾荒文化,成为优秀作家阅读技巧,Python编程基础,macOS命令更新,Qwen 3.8 27B模型逆向工程能力,Wi-Fi 8网络可靠性提升,MartyPC模拟器准确性,AMD Athlon XP处理器易损坏,NetBSD稳定性改善工作与生活平衡。
8月23日
19:03
19:03IT之家博客/媒体
SpiralAI 开发的《RyzaChat:AI》因预约人数超预期,延期上线。原定 8 月 18 日上线,现目标下周开服。游戏以《莱莎的炼金工房》为基础,采用 SpiralLLM 大语言模型生成文本,莱莎插画由人工绘制。

推荐理由:SpiralAI 的《RyzaChat:AI》延期上线,莱莎插画人工绘制,SpiralLLM 大语言模型生成文本,体验不一样的《莱莎》故事。
8月20日
23:05
23:05官方账号Decoder@Maximilian Schreiner
78°
图灵奖得主理查德·萨顿称合成数据是扩展大语言模型的“大错误”。他认为世界是无限复杂的,任何模拟都只是“微观的”。人类专业知识会成为瓶颈,阻碍真正的扩展。萨顿的替代方案是让智能体从自身经验中持续学习,而不是依赖冻结的模型。

推荐理由:图灵奖得主萨顿说合成数据是扩展大模型的“大错误”,他认为世界太复杂,应该让智能体从真实经验中学习。
23:04
8月6日
11:16
11:16官方账号arXiv cs.LG@Zheyuan Zhang, Manqing Mao, Hong Wang, Zhuoer Wang, Samson Koelle, Jie Yuan, Yanjun Lin, James Feng, Nikki Lijing Kuang, Yanfang Ye, Wei Niu
RAIL是一种训练时框架,通过在线上下文bandit建模干预选择,学习如何为策略生成rollout。它利用影子到实时程序收集干预轨迹,训练恢复控制器,使控制器随策略演化持续学习。在多个设置下,RAIL在有限rollout预算下持续提升性能。结果表明恢复感知干预能生成更有信息量且更少冗余的rollout,增强后训练的学习信号。
推荐理由:这篇论文提出RAIL,把干预选择当成在线学习问题,让模型在有限预算下学到更有效的rollout,适合做RL后训练的人看。
7月28日
12:26
12:26官方账号arXiv cs.AI@Zhen Huang, Yikun Wang, Shijie Xia, Pengfei Liu
DataOrchestra提出针对每个数据样本定制处理流程,统一丢弃、保留或清洗操作。清洗时选择程序化编辑或LLM重写,并生成具体指令。在0.5B至7B模型上从零预训练,11个基准平均提升优于单个处理方法。数学持续预训练中超过更强基线,且跳过不必要操作减少计算量。
推荐理由:这篇论文提出了DataOrchestra,能针对每个数据样本定制清洗流程,在多个模型和基准上都有提升,还节省算力。
7月2日
6月28日
02:10
6月25日
16:26
16:26官方一手pandaily@contact@pandaily.com (Pandaily)
6月23日,字节跳动正式推出旗舰大语言模型Doubao-Seed-2.1 Pro(豆包2.1 Pro)。该模型每日token调用量达到180万亿,突破生产级应用阈值。这一指标表明模型在稳定性和吞吐量上已能满足大规模商业部署需求。
事件专题

推荐理由:字节家的豆包2.1 Pro每天能处理180万亿个token,直接跨过生产级门槛,做大规模AI应用时可以考虑它。