11:49官方一手arXiv: DeepSeek@Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Zicheng Li, Xuanqi Peng, Fei Teng, Jiacong Mi, Honghan Wu精选73°该研究提出了一种行为融合模型,结合大语言模型和本体排序器进行罕见病诊断。在Phenopacket Store和RAMEDIS数据集上,融合方法将Phenomizer Recall@1分别提升7.86和20.18个百分点。当与DeepSeek-V4-Flash API结合时,融合模型将Recall@1从0.1657提升至0.2176,提升5.19个百分点,无需重新训练。90.8%的正确融合诊断保留了可检查的本体证据。论文本体排序器罕见病诊断大语言模型2 个信源在谈事件专题推荐理由:研究将LLM与本体排序器融合,提升罕见病诊断准确率,同时保留可追溯的证据链。原文稍后读已读值得跟进有用关注 本体排序器
11:47官方一手arXiv: OpenAI@Til Jordan研究人员测试了九个来自三家公司的大语言模型,探究门脸效应(先提大要求被拒后再提小要求)是否有效。在Anthropic的Opus 5模型上,该技术使合规率从29.3%提升至65.8%。但在OpenAI和Google的前沿模型以及Haiku 4.5上,反而降低了15.5至23.0个百分点的合规率。研究发现,拒绝行为本身对所有模型都有影响,但模型家族对拒绝的反应各不相同。论文Opus 5门脸效应拒绝行为10 个信源在谈事件专题推荐理由:Anthropic模型对人类说服技巧有反应,而OpenAI和Google模型反而更抗拒,这种差异很有意思。原文稍后读已读值得跟进有用关注 Opus 5
03:32Julien Chaumond@julien_c78°美国司法部表示,在受版权保护的作品上训练大语言模型不违反版权法。该机构认为,将此类训练视为侵权行为会损害美国的科学、繁荣和国家安全。这一立场与纽约时报对OpenAI的诉讼形成对立。美国政府的表态可能影响未来AI训练数据的法律边界。行业OpenAI版权法大语言模型10 个信源在谈事件专题推荐理由:美国政府明确表态支持OpenAI,认为AI训练不侵犯版权,与纽约时报诉讼立场对立。原文稍后读已读值得跟进有用关注 OpenAI
10:07官方账号arXiv cs.LG@Zhiliang Chen, Sebastian Ament, David Eriksson, Maximilian Balandat, Eytan Bakshy, Jihao Andreas Lin精选73°研究人员提出Power-Law Entropy Search (PLES)方法,用于高效估计大语言模型训练的最佳超参数缩放定律。PLES基于多保真度贝叶斯优化,通过自适应实验减少计算资源消耗。在合成基准、真实LLM训练数据和实际预训练任务中,PLES仅需传统网格搜索不到十分之一的计算量,就能收敛到准确的超参数缩放定律。论文PLES超参数缩放定律贝叶斯优化推荐理由:PLES让大模型训练调参效率提升10倍,用小规模实验预测大规模最优配置。原文稍后读已读值得跟进有用关注 PLES
09:39官方账号arXiv cs.AI@Chao Gao, Haijiang Liu, Qiyuan Li, Caicai Guo, Frank van Harmelen, Jinguang Gu研究显示大语言模型在面对支持导向和消除导向两种表述方式的多选题时,回答常不一致。研究者引入双框架协议,通过最小变化的提示词保持评估目标固定。研究发现两种框架在中间层诱导出可分离的[STATE]激活。交换这些激活能系统性地改变预测结果,提高跨框架一致性。论文StateSwap多选题大语言模型推荐理由:这篇论文揭示了大模型在多选题中不一致回答的内部机制,通过StateSwap技术证明了不同表述方式会激活不同内部状态。原文稍后读已读值得跟进有用关注 StateSwap
05:13techcrunch@Tim Fernholz73°OpenAI正在准备发布其最新的关键性大语言模型Astra。该模型在计算机系统安全测试中表现出色。OpenAI已预览了为Astra发布采取的预防措施。Astra是OpenAI最新的网络安全相关大模型。AI模型OpenAIAstra大语言模型10 个信源在谈事件专题推荐理由:OpenAI要发Astra了,这模型擅长破解电脑系统,还提前展示了安全防护措施。原文稍后读已读值得跟进有用关注 OpenAI
11:25官方账号arXiv cs.AI@Hamed Babaei Giglou, Sören Auer, Peio Popov, Mahsa Sanaei, Jennifer D'Souza73°OntoAligner-Ensemble是一个模块化框架,通过两阶段投票融合策略整合不同本体对齐技术。该框架支持字符串对齐器、知识图谱嵌入模型和基于大语言模型的检索增强生成对齐器。在OAEI五个赛道八项基准测试中,集成融合显著提升了精确率和召回率的平衡,异构跨范式集成通常提高精确率,同质LLM集成更常实现更高F1分数。论文OntoAligner-Ensemble本体对齐知识图谱推荐理由:研究人员提出本体对齐集成框架,通过投票融合不同技术,在多个基准测试中超越单一对齐器性能。原文稍后读已读值得跟进有用关注 OntoAligner-Ensemble
11:21官方账号arXiv cs.AI@Qiyao Yan, Chenpeng Wang, Liangming Pan精选73°研究人员发现大语言模型在推理任务失败时,可能并非缺乏底层能力,而是输出阶段存在瓶颈。通过隐藏状态探测,即使在序列评分完全崩溃的情况下,仍能解码出正确答案。使用最小化无标签校正协议,仅用25个未标记样本和2个参数,就能为Qwen3.5模型恢复9-34个准确点,该方法成功迁移到OLMo-2-1B和Llama-3.1-8B模型。论文Qwen3.5Llama-3.1-8BOLMo-2-1B推荐理由:发现大模型推理失败不等于能力缺失,用简单方法就能恢复被掩盖的内部逻辑。原文稍后读已读值得跟进有用关注 Qwen3.5
09:25官方账号arXiv cs.LG@Jieying Xue, Phuong Minh Nguyen, Minh Le Nguyen, Shogo Okada精选73°该研究探索了功能向量(FVs)在多语言多标签情感识别任务中的跨语言迁移能力。研究显示,从源语言提取的功能向量能在零样本设置中显著提升目标语言性能,无需推理时提供演示。每个大语言模型在构建有效功能向量时表现出相对稳定的最佳注意力头范围,且这一模式在不同语言中保持一致。论文功能向量情感识别跨语言推荐理由:论文发现功能向量能跨语言传递任务信号,无需演示即可提升多语言情感识别性能,比少样本学习更高效。原文稍后读已读值得跟进有用关注 功能向量
09:32官方账号arXiv cs.AI@Hefan Zhang, Bingquan Zhang, Ming Cheng, Saeed Hassanpour, Weicheng Ma, Soroush Vosoughi精选研究分析了8个分类任务、2个生成任务和30个模型的语言自信与内部自信差异。分类任务中,语言自信与基于logits的自信在关联性、幅度一致性和校准性三个维度上经常不一致。生成任务中,语言自信无法有效跟踪基于语义熵的不确定性。指令微调模型通常报告更高自信,但自信差距更大且校准更差。论文大语言模型置信度校准推荐理由:8个分类任务+30个模型研究显示,LLM说的自信程度和实际内部自信经常不一致原文稍后读已读值得跟进有用关注 大语言模型
09:06官方账号arXiv cs.LG@Niccolò Ajroldi, Diana Alexandra Onutu, Haider Al-Tahan, Jörg Franke, Sampo Pyysalo, Jenia Jitsev, Aaron Klein73°该研究分析了英语语料上预训练密集大语言模型的学习率和批量大小缩放行为。研究开发了捕捉学习率和批量大小与模型容量和数据规模关系的模型。研究评估了最近提出的缩放形式,发现它们能有效捕捉实验中的欠训练和过训练状态。研究建立了OpenEuroLLM模型开发的基准和缩放程序。论文OpenEuroLLM大语言模型学习率推荐理由:OpenEuroLLM团队开源了预训练研究,揭示了学习率和批量大小如何随模型和数据规模变化。原文稍后读已读值得跟进有用关注 OpenEuroLLM
21:16IT之家(博客/媒体)精选Debian社区近日对大语言模型辅助开发进行投票表决,共有9种选项。最终第5个选项'负责任地使用生成式AI'以孔多塞投票制胜出。新政策允许开发者使用AI提升生产力,但要求AI生成的代码和文档必须满足质量和法律合规要求。最终责任由人类开发者承担,但不会强制标注AI使用情况。行业Debian生成式AI大语言模型推荐理由:Debian通过了AI使用新规,允许开发者用AI提效,但人类要对AI生成内容负最终责任。原文稍后读已读值得跟进有用关注 Debian
19:13官方账号arXiv cs.LG@Jackie Baek78°研究测试了gpt-5.6-sol模型在库存控制、排队网络控制和优化选择三类运筹问题上的表现。该模型在两级测试中均匹配或超越现有最佳方法,即使算法在评估实例前已固定。模型性能在八个月内发布的不同版本间显著提升,表明此能力发展迅速。AI模型gpt-5.6-sol运筹算法大语言模型推荐理由:gpt-5.6-sol单次查询就能生成与专业方法相当的运筹算法,无需人工调优。原文稍后读已读值得跟进有用关注 gpt-5.6-sol
17:08官方账号arXiv cs.AI@Nicholas J. Hallman, Zachary T. Kowaleski, Anu Puvvada, Jaime J. Schmidt研究分析了2025年一家大型企业近4,000名后台员工的713,564个提示词及对应回复。高级员工展现出更复杂的AI使用模式,与专业知识互补。不同部门使用复杂度差异显著,战略、数字化创新和项目管理部门最高。研究未发现使用复杂度随时间提升或正式AI培训后持续改善的现象。论文生成式AI大语言模型企业AI应用推荐理由:大企业内部AI使用真实数据,揭示高级员工如何更聪明地使用AI,以及培训效果有限。原文稍后读已读值得跟进有用关注 生成式AI
11:02官方账号arXiv cs.LG@Xiaodong Wu, Wenyi Yu, Chao Zhang, Philip Woodland精选研究通过Transformer损失景观的谱探针分析,解释了为什么Muon比Adam在大语言模型预训练中表现更好。提出Spectral-Aware Muon (SAMuon)改进方案,通过静态谱先验放大bulk部分,在124M到1B参数的模型上优于AdamW和Muon基准。SAMuon需要更少的训练token达到相同验证损失。论文Muon谱分配大语言模型推荐理由:这篇论文揭示了为什么Muon优于Adam,并提出了改进方案SAMuon,值得AI模型研究者关注。原文稍后读已读值得跟进有用关注 Muon
09:38SuperTechFans(博客/媒体)精选本地大语言模型因推理栈差异导致数学一致性破坏,感觉比实际更笨。匹兹堡拾荒文化展现废金属回收便利性。成为优秀作家需大量阅读。Python编程基础书籍发布。hdiutil在macOS 27中被弃用。Qwen 3.8 27B模型逆向工程商业应用许可证检查。Wi-Fi 8转向提升网络可靠性。MartyPC早期PC模拟器注重准确性。AMD Athlon XP处理器易损坏。NetBSD稳定性改善工作与生活平衡。论文大语言模型匹兹堡拾荒文化写作技巧推荐理由:了解本地大语言模型表现差异,匹兹堡拾荒文化,成为优秀作家阅读技巧,Python编程基础,macOS命令更新,Qwen 3.8 27B模型逆向工程能力,Wi-Fi 8网络可靠性提升,MartyPC模拟器准确性,AMD Athlon XP处理器易损坏,NetBSD稳定性改善工作与生活平衡。原文稍后读已读值得跟进有用关注 大语言模型
19:03IT之家(博客/媒体)SpiralAI 开发的《RyzaChat:AI》因预约人数超预期,延期上线。原定 8 月 18 日上线,现目标下周开服。游戏以《莱莎的炼金工房》为基础,采用 SpiralLLM 大语言模型生成文本,莱莎插画由人工绘制。AI产品SpiralAI莱莎的炼金工房AI聊天游戏推荐理由:SpiralAI 的《RyzaChat:AI》延期上线,莱莎插画人工绘制,SpiralLLM 大语言模型生成文本,体验不一样的《莱莎》故事。原文稍后读已读值得跟进有用关注 SpiralAI
23:05官方账号Decoder@Maximilian Schreiner78°图灵奖得主理查德·萨顿称合成数据是扩展大语言模型的“大错误”。他认为世界是无限复杂的,任何模拟都只是“微观的”。人类专业知识会成为瓶颈,阻碍真正的扩展。萨顿的替代方案是让智能体从自身经验中持续学习,而不是依赖冻结的模型。行业Richard Sutton合成数据智能体推荐理由:图灵奖得主萨顿说合成数据是扩展大模型的“大错误”,他认为世界太复杂,应该让智能体从真实经验中学习。原文稍后读已读值得跟进有用关注 Richard Sutton
23:04Gary Marcus@GaryMarcusGary Marcus 指出,当前热议的技术并非大语言模型或神经网络。该技术更可能基于 XGBoost 或逻辑回归等传统算法。这些算法依赖于大量手工设计的特征。行业Gary MarcusXGBoost逻辑回归推荐理由:Gary Marcus 指出,网红热议的技术可能只是传统算法,而非大模型。原文稍后读已读值得跟进有用关注 Gary Marcus
12:41IT之家(博客/媒体)索尼SIE提交了编号18/314775的专利申请,计划用大语言模型控制的AI账号模拟未成年人聊天。这些账号会被放置在可疑用户常出没的场景,当对方主动联系时,系统通过互动判断风险。被标记的用户若后续联系真实玩家,系统会提前警告或保护。仅聊天不会被处罚,但多次可疑行为会导致账号封禁。该专利尚未确认会落地到PlayStation平台。行业PlayStation索尼AI安全推荐理由:索尼申请了个专利:用AI假扮小孩钓鱼,恶意聊天会被标记,多次直接封号。是专利,还没实装。原文稍后读已读值得跟进有用关注 PlayStation
23:01Geek@geekbb微信团队推出WeLM系列大语言模型,核心设计理念是资源效率。该模型家族由微信内部团队开发,旨在降低大模型的部署和运行成本。WeLM的发布表明微信在AI领域开始自研基础模型。目前官方尚未公布具体参数规模和基准测试成绩。AI模型WeLM微信大语言模型推荐理由:微信自己下场做模型了,叫WeLM,主打省资源,想看看它跟其他开源模型比有啥不一样的可以关注下。原文稍后读已读值得跟进有用关注 WeLM
10:25官方账号arXiv cs.AI@Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo, Jian-Bin Wu, Yun-Nung ChenAvalon-ToM-Bench 将心智理论拆分为 2×2 分类法,涵盖认知与动机推理、推断与行动。对 28 个大语言模型的测试显示,模型对游戏规则理解良好,但心智理论能力明显偏弱。线性探测从隐藏状态恢复心智判断的准确率达 77-82%,高于模型自身思维链的 62-70%。专门的推理训练平均带来 +11.0 分提升,而测试时思维链仅 +1.1 分。论文Avalon-ToM-Bench心智理论大语言模型推荐理由:想测 AI 到底懂不懂人心?这个基准用阿瓦隆桌游把心智理论拆成细粒度任务,28 个模型都栽了。原文稍后读已读值得跟进有用关注 Avalon-ToM-Bench
10:28官方一手arXiv: OpenAI@Xinwei Liu, Junyuan Liang, Jianting Zhang, Wuhui Chen精选ProDVI是一个利用大语言模型为强化学习智能体提供初始化先验的新框架。它让代码生成模型输出Python函数,编码对环境动力学的粗略假设,再生成合成转移数据。这些数据用于预训练actor-critic价值网络的状态-动作编码器,使智能体在在线强化学习开始前获得动力学感知的表示。在OpenAI Gym和DeepMind Control Suite任务上,ProDVI显著提升了无模型强化学习算法的样本效率。论文ProDVI强化学习大语言模型10 个信源在谈事件专题推荐理由:这篇论文用大语言模型写代码来初始化强化学习,不用模拟器和预收集数据,在Gym和Control Suite上都能省样本。原文稍后读已读值得跟进有用关注 ProDVI
11:16官方账号arXiv cs.LG@Zheyuan Zhang, Manqing Mao, Hong Wang, Zhuoer Wang, Samson Koelle, Jie Yuan, Yanjun Lin, James Feng, Nikki Lijing Kuang, Yanfang Ye, Wei NiuRAIL是一种训练时框架,通过在线上下文bandit建模干预选择,学习如何为策略生成rollout。它利用影子到实时程序收集干预轨迹,训练恢复控制器,使控制器随策略演化持续学习。在多个设置下,RAIL在有限rollout预算下持续提升性能。结果表明恢复感知干预能生成更有信息量且更少冗余的rollout,增强后训练的学习信号。论文RAIL强化学习大语言模型推荐理由:这篇论文提出RAIL,把干预选择当成在线学习问题,让模型在有限预算下学到更有效的rollout,适合做RL后训练的人看。原文稍后读已读值得跟进有用关注 RAIL
09:52官方账号arXiv cs.AI@Osei Brempong, Mohammed Ayman Habib, Vivan Poddar, Morteza FayaziORACLE是一个基于强化学习的开源模拟电路设计优化框架,将标量奖励替换为向量化学习与偏好条件控制。它用偏好向量指定多个目标的相对权重,单个模型无需重训即可覆盖不同权衡场景。论文提出归一化权重与余弦对齐两种偏好引导策略,并加入大语言模型动作筛选。在多种电路拓扑的2000个测试用例上,ORACLE相比最先进方法运行时间降低20.4倍到104.4倍,满足99.9%的目标规格,输出品质因数提升5.1倍到318.6倍。论文ORACLE模拟电路设计强化学习推荐理由:ORACLE开源了:一个模型按偏好向量调模拟电路,不用重训;2000个用例上比现有方法快20-104倍。原文稍后读已读值得跟进有用关注 ORACLE
12:24官方一手arXiv: OpenAI@Masahiro Oda这篇综述聚焦扩散模型与大型语言模型在医学影像处理中的应用。文中以DALL-E 3、Stable Diffusion为例介绍图像生成模型,以ChatGPT、Gemini为例介绍文本生成模型。文章概述了这些模型在诊断报告生成、医学摘要等医疗支持任务中的用途。还探讨了基础模型的构建方法及其在医学领域的应用,并提出了利用国家级数据与算力开发医学AI的路径。论文医学影像扩散模型大语言模型推荐理由:这篇arxiv论文把扩散模型和大语言模型在医学影像里的应用讲得挺清楚,还介绍了基础模型怎么建,适合想了解医疗AI技术路线的人。原文稍后读已读值得跟进有用关注 医学影像
11:08官方账号arXiv cs.LG@H. Martin Gillis, Thomas Trappenberg这篇综述系统梳理了深度学习中的不确定性量化(UQ)方法,聚焦集成近似和近似贝叶斯两大类。作者将方法分为五个家族:贝叶斯神经网络、蒙特卡洛Dropout、深度集成、高效集成近似以及最后一层或单次前向方法。文中同时讨论了证据网络、保形预测、事后校准,以及分布外检测和选择性预测。综述还对比了熵分解与成对散度度量,并单独讨论了大型语言模型中的不确定性。论文不确定性量化深度学习贝叶斯神经网络推荐理由:想搞清深度模型怎么给出靠谱置信度?这篇把贝叶斯、Dropout、集成、单次前向等方法全梳理了一遍,还讲了各自局限,适合入门和选型参考。原文稍后读已读值得跟进有用关注 不确定性量化
12:26官方账号arXiv cs.AI@Zhen Huang, Yikun Wang, Shijie Xia, Pengfei LiuDataOrchestra提出针对每个数据样本定制处理流程,统一丢弃、保留或清洗操作。清洗时选择程序化编辑或LLM重写,并生成具体指令。在0.5B至7B模型上从零预训练,11个基准平均提升优于单个处理方法。数学持续预训练中超过更强基线,且跳过不必要操作减少计算量。论文DataOrchestra大语言模型数据清洗推荐理由:这篇论文提出了DataOrchestra,能针对每个数据样本定制清洗流程,在多个模型和基准上都有提升,还节省算力。原文稍后读已读值得跟进有用关注 DataOrchestra
00:04官方账号Logan Kilpatrick@OfficialLoganK78°谷歌宣布启动Gemini 4的预训练,这是其迄今为止最雄心勃勃的训练项目。该模型目前处于早期阶段,具体参数和完成时间尚未公布。外界预期Gemini 4将在多模态和推理能力上实现显著提升。这一训练规模可能超过此前所有Gemini版本,对标GPT-5等竞品。AI模型Gemini 4Google预训练2 个信源在谈事件专题推荐理由:谷歌官宣Gemini 4开练,号称最大规模训练,想看看它能做到多强吗?原文稍后读已读值得跟进有用关注 Gemini 4
18:21IT之家(博客/媒体)73°2024年图灵奖得主理查德·萨顿在WAIC 2026主论坛上表示,当前AI系统主要依赖人类数据转移,这种方法已达极限,无法生成新知识。他对比AlphaGo和婴儿学习,指出大语言模型缺乏奖励信号,无法区分真假。萨顿认为AI目前“比较弱小且不可靠”,但同时强调其有用性。阶跃星辰董事长印奇则预测2026年模型能力跨越临界点,智能体将从聊天工具进化为生产力最小单元。行业理查德·萨顿WAIC阶跃星辰推荐理由:图灵奖得主萨顿批评大模型“弱小不可靠”,阶跃星辰印奇却押注AGI就在眼前,两种观点直接碰撞,值得一看。原文稍后读已读值得跟进有用关注 理查德·萨顿
16:54IT之家(博客/媒体)小米自研 MiMo 模型已完成大语言、多模态、语音等全系列模型矩阵闭环,并通过国家端侧大模型备案。该模型采用端云协同架构,将全面赋能人车家全生态。小米计划 2026 年在 AI 领域投入 160 亿元,未来三年 AI 总投入不低于 600 亿元。AI模型小米MiMo端侧模型推荐理由:小米的 MiMo 模型正式备案了,端侧大模型覆盖语言、多模态、语音多种能力,还计划砸 600 亿搞 AI,快来看看他们的布局。原文稍后读已读值得跟进有用关注 小米
09:30官方账号arXiv cs.AI@Daehoon Gwak, Minhyung Lee, Junwoo Park, Jaegul Choo本文对扩散大语言模型(dLLM)的推理加速技术进行了系统综述。研究指出,并行生成并不天然带来实际速度提升,需要专门推理机制如扩散感知缓存与复用。作者提出了一个统一的延迟分解框架,用于解耦算法、架构和系统层面的因素。文章从算法创新、架构与系统优化、推理时缩放三个维度对加速技术进行了分类。最后,给出了可重复基准测试的指南,并指出了实现并行生成潜力所面临的开放挑战。论文扩散模型大语言模型推理优化推荐理由:想了解怎么让扩散大模型跑得快?这篇综述把加速方法分了三个维度,还给了评测框架,搞推理优化的值得看。原文稍后读已读值得跟进有用关注 扩散模型
10:47官方账号arXiv cs.AI@Cláudio Lúcio do Val Lopes, Lucca Machado da Silva金融异常检测面临极端类别不平衡,传统单目标算法常出现“欺诈崩溃”。研究者提出 Semantic Pareto-DQN,一个基于多目标强化学习的框架。它利用大语言模型将异构交易特征编码为自然语言状态表示,并优化包含金融效能、操作摩擦和语义发现的向量奖励。在电子商务欺诈和UCI Credit数据集上,该框架成功打破零召回陷阱,相比标量化基线提升了少数类召回率。AI模型Semantic Pareto-DQN多目标强化学习金融异常检测推荐理由:金融欺诈检测的老大难问题有了解法:Semantic Pareto-DQN 不用重采样,直接多目标优化,既能抓到欺诈又少误拦正常交易。原文稍后读已读值得跟进有用关注 Semantic Pareto-DQN
09:25官方账号arXiv cs.AI@Sahil Kale该论文从时间维度研究大语言模型(LLM)的置信度估计,比较了预解答的Feeling-of-Knowing(FOK)和后解答的Judgement-of-Learning(JOL)在不同的前沿和开源LLM上的表现。实验表明,后解答置信度校准更好、判别力更强,而基于隐藏表示的线性探针能提取比模型显式表达更丰富的置信度信息。作者提出未来置信度蒸馏方法,使用后解答正确性探针作为教师,训练仅基于预解答隐藏表示的预测器。该预测器在仅用预解答信息的情况下恢复了后解答置信度的大部分校准改进,且样本效率高、在同类数据集间可迁移。论文大语言模型置信度估计知识蒸馏推荐理由:这篇论文提出了一种新方法,可以在模型回答之前就预测它的置信度,比传统方法更准更省计算成本。原文稍后读已读值得跟进有用关注 大语言模型
10:16官方账号arXiv cs.AI@Bingchen Zhao, Sara Beery, Oisin Mac AodhaDiscoPER是一个基于大语言模型的自主科学发现框架,能够在不预设研究目标的情况下动态生成和探索假设。该系统通过代码执行分析数据集,并通过统计检验验证每个发现,在iNatDisco多模态生态知识基准上恢复了9个已知模式中的8个,假设支持率达72.7%。相比经典因果发现和LLM基线方法,DiscoPER性能更优,消融实验也证实了其第二阶元反思机制的有效性。AI模型DiscoPERiNatDisco科学发现推荐理由:DiscoPER能自己挖掘数据规律,在生态基准上检出率接近90%,比传统因果方法好用多了。原文稍后读已读值得跟进有用关注 DiscoPER
04:00官方一手Berkeley BAIR Blog(博客/媒体)加州大学伯克利分校BAIR实验室庆祝2026届博士毕业生。Charlie Snell研究LLM测试时扩展与预训练之间的权衡,提出了如何将测试时推理转化为模型持久表示的关键挑战。Eve Fleisig设计语言模型以可靠公平地服务真实用户,利用用户偏好分歧进行训练与评估。Baifeng Shi构建通用视觉与机器人模型,毕业后加入Physical Intelligence。Devon Guillory研究计算机视觉中的数据偏移,致力于构建协作AI系统。行业BAIRBerkeley博士毕业生推荐理由:看看BAIR今年毕业的博士们都在忙啥——有研究LLM推理的、有做机器人模型的、还有搞AI公平性的,都去了不错的去处。原文稍后读已读值得跟进有用关注 BAIR
12:14AI Will@FinanceYF59名志愿者佩戴MEG(脑磁图)设备,每人录10小时脑活动,共收集约2.2万句话,相比v1版本仅约2000句提升了11倍。通过端到端深度学习处理原始脑电信号,再微调大语言模型,将神经数据与连贯语言之间的差距补上。该研究展示了从脑信号直接解码语言的技术可行性。论文MEG端到端深度学习大语言模型推荐理由:这研究把脑机接口的数据量从2000句干到2.2万句,用MEG+深度学习+LLM直接解码脑信号,实打实进步。原文稍后读已读值得跟进有用关注 MEG
09:59官方账号arXiv cs.LG@Peilin Liu, Ding-Xuan Zhou论文提出一个基于分布回归的Transformer学习框架,将两阶段采样过程与自然语言处理关联。定义了注意力算子,证明Transformer可无损压缩分布为函数表示。相比卷积神经网络和全连接网络,Transformer在更复杂结构的功能学习上表现更强。该框架还为大语言模型中的提示调优、参数高效微调、高效缩放等技术提供理论洞见。论文Transformer注意力机制分布回归推荐理由:这篇论文给Transformer的提示调优、微调等技术找到了数学理论,解释了为什么注意力机制能压缩信息。原文稍后读已读值得跟进有用关注 Transformer
02:10berryxia@berryxia一位老师通过生动的例子讲解大语言模型的原理,涵盖Transformer架构和注意力机制。适合AI初学者快速理解核心概念。技巧大语言模型教程入门推荐理由:这个老师的讲解很接地气,没基础也能听懂,推荐给想入门LLM的朋友。原文稍后读已读值得跟进有用关注 大语言模型
16:26官方一手pandaily@contact@pandaily.com (Pandaily)6月23日,字节跳动正式推出旗舰大语言模型Doubao-Seed-2.1 Pro(豆包2.1 Pro)。该模型每日token调用量达到180万亿,突破生产级应用阈值。这一指标表明模型在稳定性和吞吐量上已能满足大规模商业部署需求。AI模型ByteDanceDoubao-Seed-2.1 Pro大语言模型6 个信源在谈事件专题推荐理由:字节家的豆包2.1 Pro每天能处理180万亿个token,直接跨过生产级门槛,做大规模AI应用时可以考虑它。原文稍后读已读值得跟进有用关注 ByteDance