AITOPAI热报
今日全部早读
地区
东盟中国趋势
外观
登录 / 注册
AITOPAI热报
全部动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
模型11:58
X$^3$-OPD:用策略对齐为音频大模型蒸馏推理能力

想提升音频模型的逻辑推理?这个框架用文本教师蒸馏,在MMSU等基准上效果拔群,比纯音频训练强很多。

aarXiv cs.LG原文
模型11:39
TTEL:利用错误定位实现推理时扩展

TTEL能定位推理错误,只重算出错部分,省近一半计算量。Qwen3-8B在编程测试上成绩亮眼,值得关注。

aarXiv cs.LG原文
模型10:33
GS-Agent:用生成式模拟创建4D物理世界

GS-Agent把多个AI智能体和物理引擎连起来,你只要说句话就能生成带物理模拟的4D场景,液体、物体碰撞都能搞定,做内容创作或模拟都省力。

aarXiv cs.AI原文
模型10:12
PATS:策略感知训练支架,提升智能体强化学习效率

PATS用动态训练支架帮弱策略少犯错,ALFWorld和WebShop上最高提升18.6%,而且部署时没负担。

aarXiv cs.AI原文
模型09:32
RUMBA:俄语用户记忆基准,细粒度评估长对话记忆

想测LLM的长对话记忆力?RUMBA这个俄语基准能细粒度诊断模型在时间推理上的强项和短板。

aarXiv cs.AI原文
模型12:27
PG-KINN:基于物理信息的Petrov-Galerkin KAN网络求解正反PDE

PG-KINN用Petrov-Galerkin方法结合KAN,在多个力学难题上精度超过PIKAN和MLP,值得做计算力学的人试试。

aarXiv cs.LG原文
模型12:08
iPANN和fPANN:区间与模糊物理增强神经网络用于不确定性本构建模

这篇论文提出了iPANN和fPANN,用区间和模糊集处理本构建模中的不确定性,能包围噪声观测,还能把不确定性传到有限元仿真里。

aarXiv cs.LG原文
模型12:06
无标签有限体积残差训练注意力图神经网络用于热流体场

这篇论文用有限体积残差训练图网络,省了标注数据,效果还比有监督好,做热流体模拟的可以看看。

aarXiv cs.LG原文
模型11:58
Adaptive Bayesian Online Learning via Expert Aggregation

这篇论文用专家聚合让贝叶斯在线学习自适应,无需事先设定学习率或先验,实验还证明能自动跟踪最强专家。

aarXiv cs.LG原文
模型11:56
PhaseAware:可解释的康复评分框架,结合边界监控与人类反馈

想用 AI 辅助康复评分又怕黑盒?PhaseAware 精度高(RMSE 降 88.9%),还能给出运动阶段和身体部位的敏感线索,方便医生审查边界案例。

aarXiv cs.LG原文
模型11:54
PIER:物理信息环境检索框架提升时间序列建模

PIER解决了嵌入检索可能忽略物理过程一致性的问题,在356个湖泊数据上验证了水温和溶氧预测的显著提升。

aarXiv cs.LG原文
模型11:32
PoTRE:一种基于认知异构性的测试时推理框架

这篇论文提出了PoTRE,用四个不同角色的智能体协作推理,在HLE上拿了新SOTA,而且比单纯堆参数的模型更省计算量。

aarXiv cs.AI原文
模型官方一手09:55
Solar Open 2: 250B MoE模型,1M上下文,专为长程智能体任务设计

Solar Open 2 发了,250B MoE 模型,1M token 超长上下文,专门跑复杂智能体任务。MMLU-Pro 和 LiveCodeBench 都领先,韩语能力还特别强,比 DeepSeek-V4-Pro 小很多但性能接近。

aarXiv: DeepSeek5 个信源在谈原文
模型12:30
BioSecBench-Surveillance:病原体基因组监测AI代理可验证基准

想看看AI在基因组监测上多不靠谱?新基准BioSecBench-Surveillance测了16个模型,最好才一半正确,细节值得细读。

aarXiv cs.AI2 个信源在谈原文
模型12:27
PathAgentBench:证据寻找型病理VLM基准

想测试病理AI能不能像医生一样在超大图片里找病灶?这个基准专门考这个,结果发现定位能力还很弱。

aarXiv cs.AI原文
模型12:09
ISO:面向RLVR的等谱优化框架,加速模型微调

如果厌倦了RLVR微调慢慢跑,试试ISO:只用1/3的训练步数就能达到同等效果,Qwen3-8B上实测有效,代码开源。

aarXiv cs.LG原文
模型官方一手11:26
VirtualSet:类型化本体世界作为LLM生成目标,实现有依据查询和受保护决策

VirtualSet让LLM不用冒SQL幻觉的风险,改天用类型安全的set表达式,BIRD上准确率反超4个百分点,写操作还能拦截瞎编的数据输入。

aarXiv: DeepSeek2 个信源在谈原文
模型12:31
GigaPath-Flash和GigaTIME-Flash:高效病理基础模型用于全切片和肿瘤微环境分析

研究者发布了两个轻量级病理AI模型,GigaPath-Flash在切片分析上几乎不输十亿参数大模型,速度快50倍;GigaTIME-Flash还能直接预测肿瘤微环境,速度更快又省显存。开源可用,做病理和免疫研究很实用。

aarXiv cs.AI原文
模型12:18
O-VAD:基于对象中心跟踪与推理的工业视频异常检测

O-VAD不用训练就能检测工业视频异常,跟踪对象状态变化,比传统方法更准。

aarXiv cs.AI原文
模型多源确认11:57
FlashRT 智能体框架实现实时多模态应用高效部署

部署多模态模型时延迟高吞吐低?FlashRT 让智能体自动优化,实测延时降 70 倍,吞吐升 3.6 倍,AMD 平台效果尤其猛。

aarXiv cs.LG8 个信源在谈原文
模型11:48
ClouDens: 针对大规模云系统监控的上下文感知异常检测框架

IBM 发的新框架 ClouDens,用图神经网络做云系统异常检测,在真实数据集上比 GRU 模型更准更早,适合做运维监控的朋友看看。

aarXiv cs.LG原文
模型11:27
CriPO:基于自蒸馏增强评分RL,解决优化信号丢失问题

这篇论文分析了评分RL中信号丢失的普遍问题(57%样本受影响),并提出CriPO自蒸馏方法,在医学和科学基准上效果更好且训练更快。

aarXiv cs.AI原文
模型官方一手10:55
SFC框架:用图结构共形预测保证科学生成的有效性

想做可靠的科学生成?SFC框架让模型一边写一边用共形预测校验事实,结果比DeepSeek和GPT-4都准,还能少犯73%的科学错误。

aarXiv: DeepSeek原文
模型10:54
数据优先本体论的显式世界模型:DaoQL多模态存储验证与反事实推理评估

这篇论文把LLM当推理引擎,把知识存进显式数据库DaoQL,反事实推理比GPT-4o单独强49个百分点,适合做高精度场景的参考。

aarXiv cs.AI原文
模型09:59
Node4All:无需数据集特定优化的通用图节点表示学习

不用为每个图数据集调参了,Node4All一个模型跑25个基准排名第5,还支持one-shot学习。

aarXiv cs.LG原文
模型09:58
蒸馏强化学习Distilled RL改进LLM后训练

这个新方法把强化学习和知识蒸馏结合在一起,解决了RL和OPD各自的短板,跨家族蒸馏效果尤其好。

aarXiv cs.LG原文
模型09:56
DynImmune-BERT: 神经ODE驱动的连续时间免疫组库模型

你要是做免疫组库时间序列分析,这个模型把神经ODE和Transformer揉在一起,能处理克隆动态和复发,比静态模型强。

aarXiv cs.LG原文
模型09:34
Apeliotes:基于扩散模型的公里尺度多层大气场生成框架

这个框架用扩散模型做公里级天气预测,垂直风误差不到3%,比传统方法快很多,做精细化气象预报的朋友可以看看。

aarXiv cs.LG原文
模型09:30
PUMA:相位-动量对齐诊断大推理模型推理病理

这篇论文的PUMA框架能实时诊断大模型推理时是有效思考还是绕圈子,在1.5B到32B模型上准确率更高且更省计算,推荐给关心推理效率的朋友。

aarXiv cs.AI原文
模型09:27
VLA-ReID:视频级关联重识别改进多目标跟踪

一篇论文提出VLA-ReID方法,专门解决蜜蜂等高度相似物体跟踪中的身份切换问题,不用额外标注就把重识别精度拉高了一大截。

aarXiv cs.AI原文
模型多源确认09:33
ActiveVision新基准:GPT-5.5和Claude Fable 5主动观察得分不足11%

想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。

aarXiv cs.AI11 个信源在谈原文
模型09:17
BusinessCaseBench:衡量AI在商业分析中的表现

想看看AI能不能做商业案例分析?这个新基准直接给模型打分,结果挺有参考价值。

aarXiv cs.AI原文
模型09:16
Loopie循环Transformer发布,IMO和IPhO获金牌

研究者发布了Loopie循环Transformer,用更少活跃参数在IMO和IPhO拿到金牌,比普通模型强很多。

aarXiv cs.AI原文
模型11:58
MeanFlowNFT:将前向过程强化学习应用于平均速度生成器

MeanFlowNFT让平均速度生成器也能用上强化学习,4步生成效果比50步的RL模型还好,值得试。

aarXiv cs.LG原文
模型11:51
NeuronSoup:无需反向传播的异步共享神经元时间图进化架构

NeuronSoup用遗传算法进化共享神经元图,不依赖反向传播,在MNIST上达到85.9%准确率,模型只有115KB,适合探索非梯度训练的新路子。

aarXiv cs.LG2 个信源在谈原文
模型多源确认11:32
RoboTTT:将机器人策略视觉上下文扩展到8000时间步

NVIDIA发布了RoboTTT,能把机器人策略的上下文窗口做到8000步,看懂人类演示后直接模仿,长任务完成率比单步模型高87%。想了解机器人怎么学更长历史可以看这个。

aarXiv cs.AI3 个信源在谈原文
模型10:00
T2MLR: Transformer中层循环提升推理能力

一种新的Transformer改进:只改中间20%的层加个循环机制,就能让模型推理更持久,而且可以直接改装现有模型不用从头训。

aarXiv cs.AI原文
模型09:58
MedFailBench:临床医生构建的医疗AI安全边界开源基准

临床医生亲自设计的AI安全测试,能精准定位模型在哪类医疗错误上出问题,搞医疗AI的必看。

aarXiv cs.AI原文
模型09:41
HGA:在16GB显存上实现16384令牌长上下文微调

Qwen3-8B长上下文微调显存不够?HGA方案在16GB卡上跑16384令牌,比密集训练省显存还快一点,代码正在路上。

aarXiv cs.AI原文
模型官方一手09:31
o4-mini评估:解决大学物理问题准确率约90%,图文问题仅79%

OpenAI的o4-mini做大学物理题整体准,但看图题就露馅了,准确率从96%掉到79%。

aarXiv: OpenAI11 个信源在谈原文
‹ 上一页
123…8
下一页 ›
今日全部早读东盟登录