AITOPAI热报
今日全部早读
地区
东盟中国趋势
外观
登录 / 注册
AITOPAI热报
全部动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
模型13:08
FusionRS: 首个大规模RGB-红外遥感双模态视觉语言数据集

FusionRS填补了RGB-红外双模态遥感数据集的空白,用公开RGB图转红外风格,加上两种描述,让模型同时理解可见光和红外信息。

aarXiv cs.AI原文
模型12:28
Geometric Action Model 提出借助几何基础模型实现机器人策略学习

这篇论文提出了一种新思路:用几何基础模型直接做机器人操作策略,不依赖二维图像,效果更快更准更轻。

aarXiv cs.LG原文
模型12:22
HAMON:用于长程预测的无源光学序列混合

这篇论文用纯光学硬件做时序预测,在多个基准上不输甚至超过数字模型,为低功耗预测提供了新思路。

aarXiv cs.LG原文
模型12:16
ROVE:通过强化学习解锁人形机器人操作的人类干预

人形机器人操作新方法ROVE,用强化学习从糟糕的人类演示中挑出好动作,真实任务效果比基线好。

aarXiv cs.LG原文
模型11:43
LaWAM:潜在世界行动模型实现高效动力学感知机器人策略

机器人策略新框架LaWAM,不用生成视频就能预测场景变化,又快又准,成功率98.6%还低延迟,推荐做机器人控制的看看。

aarXiv cs.AI原文
模型11:07
自适应表示的泛函梯度下降新算法

这篇论文提出了首个可实现的泛函梯度下降算法,能自适应调整梯度表示,理论上有收敛保证,实验上比传统FGD和神经网络更快更准。

aarXiv cs.LG原文
模型官方一手10:51
ARB4WM: 世界模型对抗鲁棒性统一评估基准

想检验你的世界模型扛不扛揍?ARB4WM这个新基准专门测视觉扰动下的鲁棒性,比单看动作空间全面多了。

aarXiv: Google DeepMind原文
模型官方一手10:46
VibeThinker-3B:探索小语言模型的可验证推理前沿

想看看3B小模型怎么打平千亿级大模型?VibeThinker-3B用AIME 94.3分、LiveCodeBench 80.2%的成绩告诉你,小模型也能杀进顶级推理梯队。

aarXiv: DeepSeek原文
模型11:12
AudioDER:面向音频大语言模型后训练的推理增强去重数据集

去重+CoT,提升音频模型推理能力

aarXiv cs.AI原文
模型11:12
Persona-Pruner:为角色扮演剪出轻量模型

剪掉90%参数还不丢演技

aarXiv cs.LG原文
模型11:11
CottonLeafVision:可解释且鲁棒的棉花叶病分类深度学习框架

98%准确率识别棉花叶病

aarXiv cs.AI原文
模型11:11
PepALD:自回归潜在扩散模型生成大环肽

PepALD赋能大环肽设计

aarXiv cs.LG原文
模型11:11
A-IHF: 图扩散残差提取器用于控制函数工具变量

新方法A-IHF搞定了工具变量残差提取

aarXiv cs.LG原文
模型11:10
ClinHallu:医疗多模态大模型推理分阶段幻觉诊断基准

诊断医疗AI幻觉的利器

aarXiv cs.AI原文
模型12:09
开源相机陷阱AI模型:YOLO26x检测英国31种哺乳动物与鸟类

生态学家和野生动物监测团队终于有了免费、高精度的AI工具,可以直接在本地运行,无需依赖付费平台。做生物多样性研究的建议试试这个模型,能大幅减少手动标注图像的时间。

aarXiv cs.LG原文
模型11:32
FADA:统一视觉语言模型实现胎儿超声解读与标注,单GPU可训练

FADA 解决了中低收入国家超声技师短缺导致的产前筛查缺口,做医疗 AI 或边缘部署的团队可以直接在手机上跑完整流程,值得关注其开源代码和模型。

aarXiv cs.AI原文
模型官方一手09:10
Kwai Keye-VL-2.0:开源MoE多模态模型,支持256K长视频理解

长视频理解和智能体场景的开发者终于有了一个开源且高效的MoE模型——Keye-VL-2.0仅激活3B参数就能处理256K上下文,做视频分析或智能体应用的团队可以直接下载权重试试。

aarXiv: DeepSeek原文
模型官方一手10:45
Hy-MT2 多语言翻译模型发布:1.8B 量化后仅 440MB,性能超微软豆包 API

做多语言翻译或端侧部署的团队终于有了一个又快又准的选择——1.8B 量化后 440MB 就能跑,性能还超过微软豆包 API,值得直接上手试。

aarXiv: DeepSeek2 个信源在谈原文
模型11:23
torchtune:PyTorch 原生后训练库,高效微调 LLM

做 LLM 微调的研究者或工程师,如果受够了黑盒框架的调试痛苦,torchtune 的模块化设计和 PyTorch 原生体验值得一试,能让你在保持性能的同时自由定制训练流程。

aarXiv cs.AI原文
模型11:38
MARS 系统在 EgoVis 2026 CASTLE 挑战赛中获第二名

多模态推理是 AI 落地的关键瓶颈,MARS 展示了如何整合视频、转录、热成像等异构数据做智能体决策,做多模态 AI 或视频理解的团队值得参考其开源代码。

aarXiv cs.AI原文
模型官方一手13:26
ChipMATE:首个自训练多智能体框架,RTL生成超越DeepSeek V4

芯片设计团队终于有了可私有化部署的RTL生成方案——ChipMATE不依赖闭源API、无需黄金测试平台,还能用厂商内部代码训练,做数字IC设计的开发者可以直接试。

aarXiv: DeepSeek原文
‹ 上一页
123…8
下一页 ›
今日全部早读东盟登录