研究拥挤混乱街景的世界模型,发布了新模型和115k数据集,比传统JEPA更擅长处理遮挡和异构交通。
它把慢吞吞的自回归VLA模型变成并行扩散模型,性能不掉,推理快2.8倍,还能跑自动驾驶多任务。
仓库布局优化不用再跑几千次模拟了,SRA 用十九分钟就能搞定,还能让机器人数量翻一倍,值得看看。
TraceViT在ARC上刷到67.8%,思路是让每步推理都有中间状态监督,代码还会开源,想搞视觉推理的可以盯一下。
SESA让AI自己出题自己练,把失败经验存下来反复用,问答准确率比SSP高1到3个点,代码已经开源了。
想搞材料或药物结构预测的可以看看:APO 不用实验标签,纯无监督也能超过全监督的 FlowDPO。
Qwen 团队发了 UI-Agent,一个模型统一手机、电脑、网页操作,移动端跑分超 Opus 4.8,还能插命令行,挺能打。
HARGO给HPC任务的RL后训练提了个新思路,不用标签就能按难度加权,四个任务上全面超过GRPO。
图学习想换新思路可以看这个:TopoFormer用扫描把拓扑结构变成token,喂给Transformer就行,比传统持久同调快还准。
评估论文图表质量?SciFigQual-Bench这个新基准让GPT-5.6-Sol驱动的SFQ-Agent打分,误差比直问模型低43%,更靠谱。
想看看AI到底能不能做会计?新出的APEX-Accounting基准拿160道真实会计题考了九个模型,最强Claude Fable-5才56%,离实际干活还差得远。
DLAM用对角高斯分布建模潜动作,解决了时间一致性差和误差累积问题,在多个机器人基准上提升了策略性能。
想评估音频大模型的信息还原能力?MMAC有五千多段音频和十五个细粒度维度,比只看生成质量更靠谱。
想自动给论文图表打分?SciFigAlign比顶级大模型裁判准59%,还能区分同论文哪张图更好——审稿人能省大事。
如果你想了解现有AI智能体到底能多深地理解用户,这个新基准Setoka用心理学理论和方法测出了它们的短板——不只是翻聊天记录,还要推断行为和性格。
这篇论文提出一个新架构,让围棋AI不用大量搜索也能在普通电脑上达到专业水平,比AlphaZero更省资源。
Pegasus用图结构把人类视频变成机器人能学的数据,不用砸钱搞硬件采集了,跨形态效果不错。
Pictura让自动驾驶策略直接从相机图像自对弈学,跑完3500万公里,性能逼近用真实位置速度的版本,值得AI研究员看看。
PRISM-AH在视频级矛盾识别上把macro F1从0.28翻到0.61,比直接看零样本强多了,适合研究多模态情感分析的人看看。
这个研究把SAM的内扰动改成矩阵谱范数,再用Muon做外更新,在ImageNet的ViT和ResNet上准确率都最高。
MODUS用一个解码器统一处理各种模态的输入输出,省去多个专用组件,性能不输专家模型,还开源了。
新框架DynaBridge用多模态数据和语义摘要预测抑郁焦虑压力,在AdoDAS上F1达0.5,比基线强。
你想微调模型干专业活又怕它变傻?MemSFT加个记忆模块,领域知识涨了,通用能力不掉,比全参数微调靠谱。
PI-BLS用伪逆一步求解PDE,比传统PINNs快得多,参数更少,效果还不差,适合做物理模拟的朋友试试。
ClinFusion用新架构统一2D/3D医学图像,在20/24基准上碾压Hulu-Med、Lingshu,甚至超GPT-5.2。医生盲评说它报告最好,值得关注。
APS团队搞了个能检索几十年知识库的RAG系统,把BM25的63.8%准确率提到了70.3%。交叉编码器是关键,去掉掉32.8%得分。科学设施运维AI神助攻,代码和基准都开源了。
这篇论文发布了一个综合框架,让你看到当前LLM在社会智能上的短板(最高才72%),并提出Zing训练和Actio推理搭配,能显著提升表现。想了解模型怎么更懂社交规矩的可以看看。
罕见病诊断难?RareLens利用多个大模型的差异推理,在各阶段都超越GPT-5等顶尖模型,准确率还高。
这篇论文把LLM里高效扩展的思路用到了扩散Transformer上,MMOE在单机8卡H100就跑出了更低的FID,比加参数更实用。
Kimi 开源了2.8T参数的K3模型,激活104B参数,能处理百万token上下文,视觉能力也不弱,性能直逼Claude和GPT-5.6,适合用来部署或研究。
用验证器帮语言模型修量子场论对偶声明,效果不错,deepseek-chat提升8个百分点,qwen-plus提升7个百分点,值得关注。
这个框架能自动设计量子化学电路,比传统ADAPT-VQE快10倍,还在真实量子计算机上跑了实验。搞量子计算化学的可以看看。
这篇论文给出了一个很实用的思路:用任务级反馈来动态路由LLM,不用每次调用都做独立决策。在多个基准上同时提升了准确率和速度。
CausalForge用Lean做因果推理自动研究,能验证证明并审计陈述,比纯LLM评审靠谱。
LunarFM把三个月球任务的六种仪器数据整合成一个模型,能直接做资源识别和地质分类,开源数据集和代码。
如果觉得 LoRA 微调大模型太费钱,κ-LoRA 只挑条件数大的矩阵来更新,参数量砍半,速度提升 16%,精度不降,值得试试。
想精确控制视频里多个物体的互动?GraphVid用交互图代替画轨迹,效果比Motion-I2V好很多,FID降了40%。
想用强化学习训练自己的 Claude Code 智能体?OpenForgeRL 让你在真实 harness 和环境中端到端训练,ClawEval 和 GUI 基准上表现不错,而且开源可用。
想要生成可变长输出的流模型?这篇提出了EFlows和EFMs,把扩张和去噪打包成一个可学操作,还能处理图和序列,挺新鲜。
做分子性质预测的朋友看过来:新模型EnsembleEGNN把多个构象编码成一个嵌入,在环肽任务上比纯序列模型效果好,R²提升到0.538。