9月3日
12:16
12:16官方账号arXiv cs.AI@Jianlyu Chen, Yuyang Hu, Hongjin Qian, Jiawei Liu, Wenqing Wei, Xiaolong Chen, Defu Lian, Zhicheng Dou, Chaozhuo Li, Qiwei Ye, Zheng Liu
精选73°
研究人员提出DisCo技能驱动型研究代理,能将广泛使用的ML仓库提炼为可重用技能。该代理创建了AREX-Skill Library,包含5000多个从1000个常用ML仓库中提炼的验证技能,组织成20个领域和178个能力家族。使用GPT-5.5作为骨干模型,在MLE-bench基准上得分提升134.3%,在PaperBench上提升34.4%,在FrontierCS上提升9.2%,在PassNet上提升14.0%。
推荐理由:DisCo代理把GitHub仓库变成可重用技能,在多个AI研究基准上大幅提升性能,比无技能版本表现更好。
11:51
11:51官方账号arXiv cs.LG@Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar, Boris Ginsburg
78°
NVIDIA研究人员使用22,000道精选问题训练了Nemotron-3-Nano-CC和Ultra-CC模型。Nano-CC模型通过后训练从130分提升至291分,配合GenCorrect策略达到468分,超过IOI 2025金牌线438.3分。Ultra-CC模型在IOI 2026模拟中取得535.4分,超越人类最高分498.27分。
事件专题

推荐理由:NVIDIA训练的编程竞赛模型首次在IOI中击败人类冠军,分数535.4远超金牌线361.12。
9月2日
10:46
10:46官方账号arXiv cs.AI@Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin
精选73°
研究人员提出H3-World框架,将33B参数的MiniMax-H3视频生成器转化为交互式世界模型。该框架通过结构化组合角色和相机指令,实现精确的时间控制,无需专用动作模块。仅需8000个游戏样本和10000步LoRA优化,H3-World在保持高质量生成的同时实现了有效控制。
事件专题

推荐理由:MiniMax团队发布H3-World,让33B视频模型通过语言精确控制角色和相机,训练成本低效果好。
10:15
10:15官方账号arXiv cs.LG@Haoyuan Deng, Haichao Liu, Wenkai Guo, Yuan Ling, Zaijia Yang, Yuanjiang Xue, Haosheng Sun, Liangzi Wang, Ziwei Wang
精选73°
Facet-0 是一个新的机器人基础模型,专为亚毫米级精密装配任务设计。该模型在 ManuFacet-1K 数据集上训练,包含 1000 小时的同步力数据。在五个亚毫米级计算机装配任务中,Facet-0 达到 82% 的平均成功率,而最强基线模型仅为 15%。系统实现了 0.5 毫米的放置精度和 50 毫秒的命令延迟。
推荐理由:Facet-0 模型通过预测和评估接触后果,让机器人能完成高精度装配,成功率比最强基线高出 5 倍多。
9月1日
10:14
10:14官方账号arXiv cs.AI@Yuheng Zhang, Yizhao Wang, Da Zhu, Hua Zhou, Yue He, Jiahui Hu, Shaman Tang, Hanlin Chen, Yuhua Wei, Anhua Liu, Shuang Su, Rui Xin, MingYuan Wang, MingHao Li, HaoJie Yang, Siqi Liu, Jianlei Zheng, WeiChao Huang, Qiman Wu, Hang Zhang, HongGou Yang, Xianming Liu
78°
Turing-20B-A2B是20B参数的专家混合语言模型,每激活约2B参数。该模型采用分位数路由和动态top-k配置,支持长上下文和低延迟物理AI应用。模型结合了Lightning Attention和少量全注意力层架构,预训练阶段能力超过Qwen3-8B Base并接近Qwen3.5-9B Base。原生上下文长度为128K,推理时可扩展至512K。
推荐理由:Turing团队发布20B参数专家混合模型,每激活2B参数,性能接近9B模型,支持超长上下文。
09:12
09:12官方账号arXiv cs.AI@Junxiang Liu, Lin Wang, Haiyu Shi, Hongxu Ma, Xiaoyu Yang, Chunjie Chen, Xiaoxiao Xu, Kaiqiao Zhan, Boao Wang, Shuizhou Shi, Tianyun Zhu, Jie Li, Jiangtong Li
精选73°
CineForge是自我演进的视频制作智能体框架,包含CineForge-Produce和CineForge-Evolve两个组件。该框架在CineScope-Data测试集上,CineScope-Metric评分从4.024提升至4.380。相比三种长视频基线模型,CineForge在ScriptAgent基准上实现稳定提升。在新故事生成中,CineForge减少了37.0%的审查LLM调用次数。
推荐理由:CineForge能自我改进视频制作能力,跨故事积累经验,生成更连贯的长视频故事。
8月28日
19:26
19:26官方账号arXiv cs.LG@Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang Gao, Yanmohan Wang, Mingzhe Zhang, Kaiyue Wen, Kaifeng Lyu, Wenguang Chen
精选73°
Poor Lab团队使用RTX 5090显卡训练了Puro-2B模型,总计算成本低于6900美元。该模型在1.4万亿token数据集上以FP8精度进行训练,性能接近Qwen2.5-1.5B。团队还提出了Puro成本缩放定律,显示约4420美元即可达到Qwen2-1.5B性能。完整训练食谱已在Apache 2.0许可下开源。
推荐理由:Poor Lab用5090显卡训练出接近Qwen2-1.5B的模型,成本不到7千,开源食谱让普通人也能训练大模型。
8月27日
11:15
11:15官方账号arXiv cs.LG@Hao Luo, Yiting Yang, Wenyi Zhao, Man Jiang, Zhijun Lin, Ghulam Mohiuddin, Ting Jiang, Kunming Luo, Zihao Zhang, Qingsen Yan, Guoqing Wang, Wei Dong, Peng Wang
We propose Channel Group-Shared (CGS) low-rank approximation for efficient large-kernel CNNs, reducing parameter volume by 87% in models like RepLKNet-31B. CGS achieves significant parameter reduction and enables feasible deployment on edge devices, improving performance and reducing storage costs.
推荐理由:Read this if you're interested in how CGS low-rank approximation can make large-kernel CNNs more efficient for mobile devices, compared to existing methods like RepLKNet-31B.
8月26日
11:28
11:28官方账号arXiv cs.AI@Kai Ruan, Jinghao Lin, Qianshan Wei, Ziqi Zhou, Zihe Huang
SPO++通过流对齐策略优化解决了Group-relative reinforcement learning的依赖问题,提高了在线学习效率。在ALFWorld和Math-TIR上的实验表明,SPO++在两个模型规模上均优于SPO。
推荐理由:SPO++在异步智能体强化学习领域取得了显著进展,提高了在线学习效率,值得一试。
10:41
10:41官方账号arXiv cs.LG@Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti, Andrej Radonjic, Thaddäus Wiedemer, Christoph Schuhmann, Romain Beaumont, Wieland Brendel, Bernhard Schölkopf, A. Sophia Koepke, Jenia Jitsev, Matthias Bethge
LAION-BVD是一个包含1.3亿个平台特定视频URL的大型开放视频数据集,下载了8000万视频,总时长达1000万小时。该数据集旨在跨视频、音频和图像模态进行多模态预训练,并在视频-文本和音频-文本基准测试中取得竞争优势。此外,还探索了视频帧作为图像-文本数据的替代来源,并发布了LAION-BVD以供研究社区使用。
推荐理由:LAION-BVD发布了,这是一个包含1.3亿小时视频的开放数据集,可用于多模态预训练,对于研究者和开发者来说是个宝库。和其它视频数据集相比,它提供了更多的视频和更长的时长,对于提升模型性能大有裨益。
8月25日
11:16
11:16官方账号arXiv cs.LG@Zhongpan Tang
ProxyFormer提出了一种基于代理标记的通用双流架构,通过压缩局部特征和仅在压缩代理空间中进行全局交互,解决了超长上下文语言模型和高分辨率生成模型的瓶颈问题。该模型在16GB GPU上,压缩比64时,可训练序列长度扩展至约0.7M,且在多针检索任务中保持92%-95%的检索准确率。
推荐理由:ProxyFormer模型在处理超长上下文和高分辨率生成方面表现出色,相较于传统模型,其压缩比高达64,训练序列长度可扩展至0.7M,值得一看。
11:02
11:02官方账号arXiv cs.LG@Federico Stella, Fei Jiang, Zhongshi Jiang, Zohar Barzelay, Emanuel Garbin, Amin Jourabloo, Liuhao Ge
Next-Scale Transformer模型在人脸多视角合成方面取得进展,通过高分辨率、多视角输出和跨视角一致性,实现更真实的人脸视图合成。模型在合成数据集上训练,无需2D预训练,使用通用预训练,最终生成清晰、逼真的3D人脸模型。
推荐理由:Next-Scale Transformer模型在人脸合成方面表现出色,与现有模型结合,生成更精确的3D人脸模型,值得关注。
10:11
10:11官方一手arXiv: Anthropic@Philipp Emanuel Weidmann, Allen Roush, Judah Goldfeder, Sanjay Basu, Ravid Shwartz-Ziv
XTC模型通过排除高概率选择,提高生成文本的多样性。在Gemma 3和DeepSeek模型上实验表明,XTC在创意生成方面提升显著,Distinct-2增加11-15%,重复三元组减少27-47%。XTC已被多个文本生成工具采用。
推荐理由:XTC模型通过排除高概率选择,显著提升了文本生成的多样性,对于需要创意文本生成的应用来说是个不错的选择。
8月24日
10:59
10:59官方账号arXiv cs.AI@Haonan Jia, Shichao Dong, Zenghui Sun, Jiawen Zheng, Ziqi Miao, Gege Shi, Qiuyu Zhao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng
本文提出Re$^3$Cap,一种基于检索引导的图像描述优化策略,通过强化学习提升图像描述准确性。该方法通过识别图像描述中的幻觉和遗漏,实现更精确的描述。在COCO-LN500基准测试中,Re$^3$Cap相较于GRPO平均提升了8.64%的相关推理性能。
推荐理由:Re$^3$Cap模型通过检索引导优化图像描述,比GRPO提升了8.64%的推理性能,值得一看。
10:45
10:09
10:09官方账号arXiv cs.LG@Vladimir Bataev, Lilit Grigoryan, Andrei Andrusenko, Nikolay Karpov, Vitaly Lavrukhin, Boris Ginsburg
TurboBias 2.0是一个针对生产级自动语音识别系统的框架,通过流式推理和批处理解码,实现个性化上下文偏置,提高识别准确率,同时保持低延迟和高吞吐量。
推荐理由:想了解如何提升ASR系统准确率的同时保持高效?试试TurboBias 2.0,它为多用户个性化上下文偏置提供了新方案。
09:53
09:53官方账号arXiv cs.LG@Mieszko Komisarczyk, Saurabh Mathur, Maurice Kraus, Sriraam Natarajan, Kristian Kersting
Tydra,一种混合Transformer-State Space Model架构,在30个OpenML数据集上,相较于TabPFN减少30%的推理时间,同时保持大部分预测性能,优于Hydra模型,表明混合架构是表格基础模型的有前景方向。
推荐理由:Tydra模型在保持预测性能的同时大幅降低推理时间,比Hydra模型更高效。
8月21日
11:05
11:05官方账号arXiv cs.AI@Christos Koutsiaris
Daedalus-150M模型采用卷积-注意力混合架构,在CPU上实现高效推理;在59.9B tokens上从头训练,五任务基准测试得分47.31,优于GPT-2 124M等模型;与全注意力模型相比,在速度上具有显著优势,同时保持相似的质量指标。
推荐理由:Daedalus-150M模型在CPU上实现了高效推理,与同类全注意力模型相比,在速度上具有显著优势,同时保持了相似的质量指标,值得一试。
10:08
10:08官方账号arXiv cs.LG@Taoyong Cui, Pheng Ann Heng, Wanli Ouyang
精选
Meta AI 提出一种名为 Orthogonal JEPA 的新框架。该框架通过正交预测分解来学习潜在世界模型。它使用正交基矩阵将目标状态分解为多个组件,并为每个组件设置专用预测分支。实验在受控视觉、单细胞转录组学、纵向健康记录、连续控制和分子动力学等多个领域进行。
推荐理由:Meta AI 推出了 Orthogonal JEPA,它能把复杂系统拆分成多个部分来预测,比标准 JEPA 更高效。
8月20日
10:20
10:20官方账号arXiv cs.LG@Sotirios P. Chatzis, Loukas Papadoulas
精选
Lévy Attention是一种新型注意力机制,可对连续时间序列查询提供信任度评估;该机制通过泊松随机测度实现,单次计算就能输出不确定性相关指标;在t-PatchGNN基准测试中,与同类方法相比仅损失5.6%精度;其输出的不确定性信号能有效提升预测可靠性,优于多轮采样方式。
推荐理由:Lévy Attention这个模型,能一次计算就给连续时间预测评信任度,和之前的方法比,在小数据场景下还保持较好表现。
10:19
10:19官方账号arXiv cs.LG@Leo Schmidt-Traub, Frédéric Berdoz, Luca A. Lanzendörfer, Roger Wattenhofer
基于残差向量量化(RVQ)的神经音频编解码器存在音频令牌重合成的难题;传统采用离散令牌预测与连续回归的方式存在局限;提出几何迭代检索方法,利用码书空间对比检索实现重合成;在语音和音乐领域的测试中,效果优于单次令token预测和一步回归基线。
推荐理由:研究团队提出几何迭代检索方法,解决了神经音频编码器重合成难题,效果比之前单次预测和回归方法好。
10:19
10:19官方账号arXiv cs.LG@Jielong Lu, Zhihao Wu, Jiajun Yu, Zhaoliang Chen, Haishuai Wang
SIMPLE模型利用合成任务先验开展多视图可复用推理预训练,在多组学基准测试中无需额外调整即可取得较好结果。该模型针对多视图和多组学场景设计,验证了可复用推理的可行性。与传统方法对比,其减少了知识重复学习的浪费,提升了应用效率。
推荐理由:SIMPLE这个模型做了个用合成任务先验做多视图可复用推理的事,在多组学数据上直接用冻结方式就好,比以前方法省事儿。
10:18
10:18官方账号arXiv cs.AI@Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa
精选
ADEPT是一种强化学习框架,通过预训练和后训练方式提升多指机器人的灵巧性。该模型在23自由度的Kuka-Allegro和29自由度的Flexiv-Sharpa上测试,可从原始感知直接完成长时任务。它先针对通用物体摆放任务进行预训练,再将预训练行为作为先验用于下游任务的后训练。通过稳定后训练流程,实现模拟到现实的转移并达到人速级别的灵巧操作。
推荐理由:我了解ADEPT这个模型,它是用强化学习让机器人更灵活,学新动作时能直接用之前的经验,和没这么训练的方法比,效果更好。
10:18
10:18官方账号arXiv cs.AI@Ramneet Kaur, Pradyumna Chari, Ramesh Raskar, Jugad Singh, Sumit Kumar Jha, Anirban Roy
Qwen3-0.6B模型在多代理拍卖场景中,通过新框架监测潜在隐蔽协作;该框架对同质化代理的检测准确率达0.993,异质化组合达0.854;测试显示对小范围竞拍者监测负载小,全白盒干预能恢复出价分布并降低合谋行为47.3个百分点。
推荐理由:Qwen3推出了VLA框架,用来监测多代理潜在通信,在小范围拍卖里表现好,你可以去了解下。