AITOPAI热报
今日全部早读
地区
东盟中国趋势
外观
登录 / 注册
AITOPAI热报
全部动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
模型12:00
BluTrain:基于C++/CUDA的AI训练框架

这个新框架用C++从头写,训练GPT-2比PyTorch快3%且省内存22%,适合追求极致性能的开发者。

aarXiv cs.AI原文
模型11:52
L3Cube-MahaPOS:马拉地语词性标注数据集及BERT模型

马拉地语有8300万使用者但标注数据稀缺,这个新数据集和MahaBERT模型基准很实用,适合做低资源语言NLP的朋友参考。

aarXiv cs.LG原文
模型11:44
ASALT:面向多智能体强化学习中状态空间维度不匹配的迁移方法

ASALT这个新方法解决了MARL中状态空间维度不同时知识迁移的难题,实验效果不错,值得做多智能体迁移学习的同学看看。

aarXiv cs.LG原文
模型11:38
MedPCFM:结合点云Transformer与流匹配提升医学点云补全

这篇论文搞了个 MedPCFM,用流匹配做医学点云补全,比扩散模型快7倍,在好几个头骨和下颌骨数据集上效果最好。

aarXiv cs.LG原文
模型官方一手09:46
用于加速罕见病诊断的专用推理大语言模型:随机AI医生辅助试验

RaDaR发布了一个32B开源推理模型,罕见病诊断比DeepSeek-R1还强,医生用它准确率提升21%。

aarXiv: DeepSeek原文
模型13:18
CoorDex: 协调身体与手部先验实现连续灵巧人形移动操作

CoorDex让人形机器人在行走时用灵巧手完成开冰箱、抓瓶子的连续操作,不再需要走走停停,和之前的笨拙模式完全不一样。

aarXiv cs.AI原文
模型12:58
Polycepta:面向多目标跟踪的对象中心外观估计

Polycepta不用死板的外观模板,边跟踪边更新目标长相,在KITTI基准上拿92.27% MOTA还跑得飞快,比传统方法稳多了。

aarXiv cs.AI原文
模型12:49
双学习匹配:十亿参数Transformer线性连通与合并

新方法让十亿参数Transformer通过双向学习实现线性合并,损失屏障极低,视觉和语言模型都验证有效。

aarXiv cs.LG原文
模型官方一手12:04
RLM-Cascade: 响应级投机解码代理层系统降低LLM API成本45.8%

这个系统把DeepSeek和Opus组合起来,用投机解码省了近一半API成本,还快了一倍,质量也有提升,而且开源可部署。

aarXiv: DeepSeek原文
模型官方一手12:00
Lost in Aggregation:LLM空间导航多尺度诊断基准

想知道LLM为什么在导航任务中迷路吗?这个基准把问题拆成三个层级,告诉你59%的锅在交叉口选择,39%在局部感知,方向判断几乎不犯错。对做空间推理的开发者非常有用。

aarXiv: DeepSeek原文
模型10:53
SCOPE:自适应符号规划框架应对开放环境长程任务

搞机器人规划的朋友可以看看 SCOPE,它用符号执行加记忆更新解决开放世界符号不完整的老问题。

aarXiv cs.AI原文
模型10:48
Qwen2.5-0.5B调优后在关系抽取上超越GPT-5.4和Claude Sonnet

Qwen2.5-0.5B调优后,在关系抽取任务上干掉了GPT-5.4和Claude Sonnet,而且模型很小,单卡就能跑,适合隐私敏感场景。

aarXiv cs.LG原文
模型10:33
AdaR:自适应递归图模型实现测试时计算

AdaR让图模型在测试时自己调整推理步数,不用重新训练,效果比传统图神经网络好。

aarXiv cs.LG原文
模型11:47
UNIEGO:代理作为中介的统一自我中心视频表示学习

想用多视角多模态数据训练视频理解模型?UNIEGO用代理模型搞定异构教师蒸馏,在三个任务上刷新了纪录。

aarXiv cs.LG原文
模型11:31
Multi-LCB:将LiveCodeBench扩展到多编程语言的新基准

想测AI写代码的真本事?别只看Python了。Multi-LCB覆盖12种语言,一测就知道模型是不是只会Python,结果可能让你意外。

aarXiv cs.AI原文
模型11:15
FreeStyle:基于社区LoRA挖掘的风格-内容双参考生成框架

想同时控制图片风格和内容?FreeStyle用社区LoRA搞定双参考生成,还自带防泄漏机制,比以往方法更稳。

aarXiv cs.AI原文
模型10:59
Agentic Symbolic Search:自动发现PDE符号解的AI框架

ASYS让AI自动去发现偏微分方程的数学结构,比如给Allen-Cahn和Keller-Segel找到了以前没人写出来的公式。搞数学或数值计算的可以看看。

aarXiv cs.LG原文
模型10:22
AutoPass: 基于证据指导的LLM编译器性能调优框架

AutoPass 把 LLM 变成编译器调优助手,不用训练就能在 x86 和 ARM 上跑出比 -O3 还快的速度,实测有 4-11% 的加速。

aarXiv cs.AI原文
模型10:16
ELVA:通过排名驱动缓解多模态检索中的粒度盲视

这篇论文提出了ELVA,用强化学习思路改多模态检索,解决了对比学习忽略粒度的问题,还在新基准MRBench上提了13.1%,值得做检索方向的人看看。

aarXiv cs.AI原文
模型09:55
CRAX: 基于JAX的快速安全强化学习基准测试,提速约100倍

想快速测试安全RL算法?CRAX用JAX把基准跑快100倍,还自带六个环境和三级难度,帮你一眼看出哪个方法在安全与性能上最均衡。

aarXiv cs.LG原文
模型09:48
QCPIKAN:量子-经典物理信息KAN用于PDE求解

这篇论文发布了QCPIKAN,首个混合量子经典PDE求解器,用Chebyshev KAN层加速收敛,渗流模拟精度远超市面同类。

aarXiv cs.LG原文
模型官方一手09:38
过程验证强化学习在Lean定理证明中的应用

这篇论文用Lean在定理证明训练中引入细粒度过程奖励,比只判对错的强化学习效果好,在MiniF2F和ProofNet上都有提升。

aarXiv: DeepSeek原文
模型10:58
ScenA:基于参考语音的多说话人音频场景生成

ScenA这个新方法能用参考语音和自然描述直接生成多人对话场景,比现有系统更自然,还带背景噪音和重叠说话。

aarXiv cs.AI原文
模型10:57
重新思考奖励监督:Rubric-Conditioned Self-Distillation

想提升推理模型训练效果?这篇用评分标准做细粒度自蒸馏,比GRPO和OPSD都强,实验扎实。

aarXiv cs.AI原文
模型10:56
大型语言吉布斯的结构化概率推理方法

这篇论文提出用LLM做MCMC采样,比直接生成更鲁棒,适合复杂推理场景,值得做概率建模的人看看。

aarXiv cs.LG原文
模型10:55
TxBench-PP基准测试:AI Agent在临床前药理学任务中表现不佳

想看看AI在药物发现中到底行不行?这个基准测试用4800条轨迹告诉你,Claude Opus 4.8和GPT-5.5都还差得远,最高才59.3%的通过率。

aarXiv cs.LG2 个信源在谈原文
模型10:31
JourneyFormer:用序列建模编码Airbnb客人旅程

Airbnb搞了个JourneyFormer,专治搜索排序中又长又乱的用户序列,实测线上A/B测试效果很不错。

aarXiv cs.LG原文
模型官方一手10:22
Diffusion-Proof:超越自回归生成的形式定理证明新框架

扩散模型也能做定理证明了,比自回归强,MiniF2F上高出6个百分点,还解了一道DeepSeek没解出的IMO题。

aarXiv: DeepSeek原文
模型09:41
ThinkDeception:渐进式强化学习框架实现可解释多模态欺骗检测

这个框架用MLLM和思维链一步步拆解欺骗线索,比黑箱模型更能解释为什么判定说谎,准确率还最高。

aarXiv cs.AI原文
模型11:35
LiL-Q:一种凸拟线性化方法求解非线性PDE,替代传统PINNs梯度训练

这个新方法LiL-Q用凸优化替代了PINNs的非凸训练,收敛快、参数少,在Navier-Stokes等难题上效果拔群,值得关注。

aarXiv cs.LG原文
模型10:43
DRFLOW 基准:评估智能体预测个性化工作流的能力

想测测你家智能体能不能给出真正可执行的步骤?DRFLOW 用 100 个企业任务逼真考核,DRFA 也才比普通基线高 10%,挑战不小。

aarXiv cs.AI原文
模型10:22
BLITZ:基于两阶段回归的快速非参数条件独立性检验

想快速做条件独立性检验?BLITZ 能在一秒内跑完,校准还比核方法好,因果发现定向更靠谱。

aarXiv cs.LG原文
模型10:19
MKAN:具有硬单调性保证的KAN网络

如果你做单调神经网络或者KAN相关研究,这篇论文提出了一个既有理论保障又有实际效果的MKAN,在基准上不输现有方法,而且保持了KAN的可解释性。

aarXiv cs.LG原文
模型10:18
AnchorKV:基于拒绝锚点的软惩罚安全感知KV缓存压缩

想压缩KV缓存又怕模型不安全?AnchorKV用软惩罚巧妙拒绝有害token,既省内存又防越狱,适合部署场景。

aarXiv cs.LG原文
模型10:17
Qwen-RobotManip技术报告:对齐解锁机器人操作基础模型的规模

阿里Qwen团队这个机器人模型用开源数据和人类演示就能学,跨平台零样本操作,还在多个测试里碾压了π0.5,做机器人开发的别错过。

aarXiv cs.LG2 个信源在谈原文
模型09:41
SegDINO:将多尺度结构引入DINO实现高效医学图像分割

医学图像分割不用再堆复杂解码器了,直接看SegDINO怎么用DINO特征加轻量多尺度建模做到又快又准。

aarXiv cs.AI原文
模型09:41
SoftMoE:可微分专家路由的混合专家模型

稀疏MoE的top-k路由不灵活还浪费算力,SoftMoE用可微路由让模型自己学会少用专家,性能却不输,代码开源了。

aarXiv cs.AI原文
模型09:39
PreAct: 让计算机使用代理在重复任务上提速8.5-13倍

想让你那个傻傻的屏幕操作AI学会重复干活不重来?PreAct把第一次成功步骤变成程序,后面直接快10倍,还不容易翻车。

aarXiv cs.AI原文
模型09:37
PearlVLA: 渐进式潜在空间具身动作规划细化

这篇论文提出了PearlVLA,把动作规划放到了潜在空间里,比传统文本链式推理延迟更低,在LIBERO上刷了SOTA,做具身智能的可以看看。

aarXiv cs.AI原文
模型官方一手09:31
DecoSearch: 复杂度感知路由与计划级修复提升Text-to-SQL

DecoSearch不用训练就能把自然语言转SQL,在BIRD和Spider上准确率分别超70%和88%,比同类方法省十倍token。想提升SQL生成效率可以看看。

aarXiv: DeepSeek原文
‹ 上一页
123…8
下一页 ›
今日全部早读东盟登录