AITOPAI热报
今日全部早读
地区
东盟中国趋势
外观
登录 / 注册
AITOPAI热报
全部动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
模型09:46
FactorJEPA:将整体未来分解为布局-智能体-交互通道

研究拥挤混乱街景的世界模型,发布了新模型和115k数据集,比传统JEPA更擅长处理遮挡和异构交通。

aarXiv cs.AI原文
模型09:36
WAM-Diff2:分层蒸馏实现高效自动驾驶VLA模型

它把慢吞吞的自回归VLA模型变成并行扩散模型,性能不掉,推理快2.8倍,还能跑自动驾驶多任务。

aarXiv cs.AI原文
模型09:33
Stress-Relief Annealing:自动化仓库布局优化的多项式时间免仿真方法

仓库布局优化不用再跑几千次模拟了,SRA 用十九分钟就能搞定,还能让机器人数量翻一倍,值得看看。

aarXiv cs.AI原文
模型10:24
TraceViT:用轨迹监督提升视觉抽象推理

TraceViT在ARC上刷到67.8%,思路是让每步推理都有中间状态监督,代码还会开源,想搞视觉推理的可以盯一下。

aarXiv cs.AI原文
模型09:21
SESA:让技能记忆参与自博弈进化的搜索智能体

SESA让AI自己出题自己练,把失败经验存下来反复用,问答准确率比SSP高1到3个点,代码已经开源了。

aarXiv cs.AI原文
模型12:26
APO:无监督原子策略优化,用于原子系统 3D 结构预测

想搞材料或药物结构预测的可以看看:APO 不用实验标签,纯无监督也能超过全监督的 FlowDPO。

aarXiv cs.LG原文
模型11:36
Qwen-UI-Agent技术报告:面向真实世界的下一代GUI智能体

Qwen 团队发了 UI-Agent,一个模型统一手机、电脑、网页操作,移动端跑分超 Opus 4.8,还能插命令行,挺能打。

aarXiv cs.AI2 个信源在谈原文
模型11:28
HARGO:异构感知奖励引导优化用于LLM的HPC任务后训练

HARGO给HPC任务的RL后训练提了个新思路,不用标签就能按难度加权,四个任务上全面超过GRPO。

aarXiv cs.LG原文
模型11:23
TopoFormer:拓扑与注意力结合的图学习

图学习想换新思路可以看这个:TopoFormer用扫描把拓扑结构变成token,喂给Transformer就行,比传统持久同调快还准。

aarXiv cs.LG原文
模型12:12
SciFigQual-Bench:面向科学图像质量评估的全文本基准

评估论文图表质量?SciFigQual-Bench这个新基准让GPT-5.6-Sol驱动的SFQ-Agent打分,误差比直问模型低43%,更靠谱。

aarXiv cs.AI原文
模型多源确认11:22
APEX-Accounting基准:评估九个前端模型会计能力

想看看AI到底能不能做会计?新出的APEX-Accounting基准拿160道真实会计题考了九个模型,最强Claude Fable-5才56%,离实际干活还差得远。

aarXiv cs.AI3 个信源在谈原文
模型11:14
DLAM:带时间约束的分布性潜在动作模型

DLAM用对角高斯分布建模潜动作,解决了时间一致性差和误差累积问题,在多个机器人基准上提升了策略性能。

aarXiv cs.AI原文
模型11:04
MMAC:一个大规模多维度音频字幕基准

想评估音频大模型的信息还原能力?MMAC有五千多段音频和十五个细粒度维度,比只看生成质量更靠谱。

aarXiv cs.AI原文
模型10:53
SciFigAlign: 通过微调对齐视觉与手稿证据评估科学图表

想自动给论文图表打分?SciFigAlign比顶级大模型裁判准59%,还能区分同论文哪张图更好——审稿人能省大事。

aarXiv cs.AI原文
模型10:38
Setoka:评估个性化智能体层次化用户理解的新基准

如果你想了解现有AI智能体到底能多深地理解用户,这个新基准Setoka用心理学理论和方法测出了它们的短板——不只是翻聊天记录,还要推断行为和性格。

aarXiv cs.AI原文
模型10:32
Belief-Guided架构:减少围棋AI对MCTS依赖的新方法

这篇论文提出一个新架构,让围棋AI不用大量搜索也能在普通电脑上达到专业水平,比AlphaZero更省资源。

aarXiv cs.AI原文
模型10:16
Pegasus:将人类视频转化为机器人可学习数据的低资源框架

Pegasus用图结构把人类视频变成机器人能学的数据,不用砸钱搞硬件采集了,跨形态效果不错。

aarXiv cs.AI原文
模型多源确认11:55
Pictura:大规模视角自对弈驾驶模拟器

Pictura让自动驾驶策略直接从相机图像自对弈学,跑完3500万公里,性能逼近用真实位置速度的版本,值得AI研究员看看。

aarXiv cs.AI5 个信源在谈原文
模型11:50
PRISM-AH:面向视频级矛盾与犹豫识别的知识引导多模态推理

PRISM-AH在视频级矛盾识别上把macro F1从0.28翻到0.61,比直接看零样本强多了,适合研究多模态情感分析的人看看。

aarXiv cs.AI原文
模型11:34
SAM与Muon结合的谱范数鲁棒性优化

这个研究把SAM的内扰动改成矩阵谱范数,再用Muon做外更新,在ImageNet的ViT和ResNet上准确率都最高。

aarXiv cs.LG原文
模型11:17
MODUS: 仅解码器的任意到任意多模态建模

MODUS用一个解码器统一处理各种模态的输入输出,省去多个专用组件,性能不输专家模型,还开源了。

aarXiv cs.AI原文
模型09:25
DynaBridge:动态摘要引导的跨任务多模态DASS-21心理评估

新框架DynaBridge用多模态数据和语义摘要预测抑郁焦虑压力,在AdoDAS上F1达0.5,比基线强。

aarXiv cs.LG原文
模型09:22
MemSFT:用外部参数化内存缓解对齐惩罚

你想微调模型干专业活又怕它变傻?MemSFT加个记忆模块,领域知识涨了,通用能力不掉,比全参数微调靠谱。

aarXiv cs.LG原文
模型09:20
物理信息宽学习系统PI-BLS:无需反向传播的高效PDE求解框架

PI-BLS用伪逆一步求解PDE,比传统PINNs快得多,参数更少,效果还不差,适合做物理模拟的朋友试试。

aarXiv cs.LG原文
模型12:30
ClinFusion: 面向整体医学理解的视觉中心多模态LLM系统

ClinFusion用新架构统一2D/3D医学图像,在20/24基准上碾压Hulu-Med、Lingshu,甚至超GPT-5.2。医生盲评说它报告最好,值得关注。

aarXiv cs.AI原文
模型12:19
APS-RAG:面向科学设施的纠正性代理混合RAG与运行评估

APS团队搞了个能检索几十年知识库的RAG系统,把BM25的63.8%准确率提到了70.3%。交叉编码器是关键,去掉掉32.8%得分。科学设施运维AI神助攻,代码和基准都开源了。

aarXiv cs.AI原文
模型官方一手12:05
Zing框架提升LLM社会智能:SoMBench基准与Actio推理架构

这篇论文发布了一个综合框架,让你看到当前LLM在社会智能上的短板(最高才72%),并提出Zing训练和Actio推理搭配,能显著提升表现。想了解模型怎么更懂社交规矩的可以看看。

aarXiv: DeepSeek2 个信源在谈原文
模型官方一手12:01
RareLens: 利用分歧大模型推理实现罕见病全病程护理

罕见病诊断难?RareLens利用多个大模型的差异推理,在各阶段都超越GPT-5等顶尖模型,准确率还高。

aarXiv: DeepSeek原文
模型11:49
MMOE:用高效专家设计现代化扩散Transformer

这篇论文把LLM里高效扩展的思路用到了扩散Transformer上,MMOE在单机8卡H100就跑出了更低的FID,比加参数更实用。

aarXiv cs.LG2 个信源在谈原文
模型多源确认11:47
Kimi K3:2.8T参数开源MoE模型,性能接近Claude Fable 5和GPT-5.6 Sol

Kimi 开源了2.8T参数的K3模型,激活104B参数,能处理百万token上下文,视觉能力也不弱,性能直逼Claude和GPT-5.6,适合用来部署或研究。

aarXiv cs.LG11 个信源在谈原文
模型10:37
DualityCert:量子场论中破损对偶声明的验证器门控语言模型修复

用验证器帮语言模型修量子场论对偶声明,效果不错,deepseek-chat提升8个百分点,qwen-plus提升7个百分点,值得关注。

aarXiv cs.AI原文
模型12:13
学习用Transformer模型制备分子基态

这个框架能自动设计量子化学电路,比传统ADAPT-VQE快10倍,还在真实量子计算机上跑了实验。搞量子计算化学的可以看看。

aarXiv cs.AI原文
模型10:58
TRACE-ROUTER:面向智能体AI的任务一致自适应在线路由框架

这篇论文给出了一个很实用的思路:用任务级反馈来动态路由LLM,不用每次调用都做独立决策。在多个基准上同时提升了准确率和速度。

aarXiv cs.LG原文
模型10:57
CausalForge:基于Lean的因果推理自动化研究框架

CausalForge用Lean做因果推理自动研究,能验证证明并审计陈述,比纯LLM评审靠谱。

aarXiv cs.LG原文
模型10:57
LunarFM:月球表面的多模态基础模型

LunarFM把三个月球任务的六种仪器数据整合成一个模型,能直接做资源识别和地质分类,开源数据集和代码。

aarXiv cs.LG原文
模型10:56
κ-LoRA:条件数决定哪些 LoRA 矩阵值得更新

如果觉得 LoRA 微调大模型太费钱,κ-LoRA 只挑条件数大的矩阵来更新,参数量砍半,速度提升 16%,精度不降,值得试试。

aarXiv cs.LG原文
模型12:22
GraphVid: 交互式图控制视频生成模型

想精确控制视频里多个物体的互动?GraphVid用交互图代替画轨迹,效果比Motion-I2V好很多,FID降了40%。

aarXiv cs.AI原文
模型12:10
OpenForgeRL:端到端训练 Harness 原生智能体的开源框架

想用强化学习训练自己的 Claude Code 智能体?OpenForgeRL 让你在真实 harness 和环境中端到端训练,ClawEval 和 GUI 基准上表现不错,而且开源可用。

aarXiv cs.AI原文
模型12:07
Expanding Flow Maps:变长生成新框架

想要生成可变长输出的流模型?这篇提出了EFlows和EFMs,把扩张和去噪打包成一个可学操作,还能处理图和序列,挺新鲜。

aarXiv cs.LG原文
模型12:00
EnsembleEGNN:环肽分子构象集成图学习模型

做分子性质预测的朋友看过来:新模型EnsembleEGNN把多个构象编码成一个嵌入,在环肽任务上比纯序列模型效果好,R²提升到0.538。

aarXiv cs.LG原文
‹ 上一页
123…8
下一页 ›
今日全部早读东盟登录