AITOPAI热报
今日全部早读
地区
东盟中国趋势
外观
登录 / 注册
AITOPAI热报
全部动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
模型11:32
OrbitQuant:无需校准数据的扩散Transformer量化方法

想给图像或视频扩散模型做低位量化?OrbitQuant不需要每换一个模型或任务就重跑校准,FLUX.1、Wan 2.1上表现都很能打,W2A4也有可用效果。

aarXiv cs.AI原文
模型11:28
EvoPolicyGym:评估自主策略演化的新基准

想看看AI智能体怎么自己迭代策略吗?EvoPolicyGym这个新基准让GPT-5.5跑了16个强化学习环境,全部拿到前两名。

aarXiv cs.AI原文
模型09:03
Dynamic Neural Graph Encoder 提升 INR 分类准确率约 10%

想搞权重空间分析的可以看看,这篇用动态图编码推理过程,在 INR 分类上直接提了 10 个点,挺实在的。

aarXiv cs.LG原文
模型12:30
TiRex-2:基于xLSTM的多变量时间序列流式预测基础模型

TiRex-2是首个同时支持多变量流式预测和已知未来协变量的时间序列基础模型,零样本刷新GIFT-Eval和fev-bench榜单,每步计算量不变。做在线时序预测的朋友可以看看。

aarXiv cs.LG原文
模型12:13
ZO-Act:通过一次性激活感知低秩子空间的高效零阶微调

ZO-Act用激活信息锁定关键子空间,让零阶微调更稳定,在Llama-3和OPT-13B上都比旧方法强,适合显存受限的场景。

aarXiv cs.LG原文
模型12:10
SynLaD: 面向3D药效团条件的可合成分子生成的潜在扩散框架

SynLaD同时搞定分子设计和合成路线,比以往只顾一头的模型更实用。

aarXiv cs.LG原文
模型11:14
GSRQ:面向子1-bit KV缓存的方向保持残差量化

这篇论文搞了个GSRQ新量化方法,1-bit下比VQLLM准22个点,专门解决KV缓存压缩时的方向丢失问题。

aarXiv cs.LG原文
模型多源确认11:05
Theoria:基于非正式推理状态的改写接受性验证

Theoria 能审计 AI 回答的每一步推理,HLE 上精度 91.4%,比纯 LLM 评判更可追溯,专治隐藏前提和伪造引用。

aarXiv cs.AI3 个信源在谈原文
模型11:03
FurnitureVLA:用视觉-语言-动作模型实现长程双手机器人家具组装

如果你关注机器人组装,FurnitureVLA用VLA模型把仿真成功率从48%拉到80%,还能在真机上跑。它处理长程任务的方式很巧妙,值得看看。

aarXiv cs.AI原文
模型10:16
DiscoPER:通过迭代元反思实现自主科学发现

DiscoPER能自己挖掘数据规律,在生态基准上检出率接近90%,比传统因果方法好用多了。

aarXiv cs.AI原文
模型09:59
LeNEPA:无需数据增强的下一潜在预测时间序列表示学习

想找一种不用数据增强的时间序列自监督方法?LeNEPA用下一个潜在预测取代传统对比学习,在跨数据集表现更稳,学习速度也快一倍。

aarXiv cs.LG原文
模型10:15
LUNA:无需线性混合蒙皮的通用3D人体动画模型

LUNA 不用传统的 LBS 蒙皮,直接用图片或关键点驱动3D角色,效果真实还能自动适配新角色,动画师和研究者可以试试。

aarXiv cs.AI原文
模型09:40
Fork-Think with Confidence:先决策后推理的高效LLM方法

Fork-Think让LLM推理更省钱省时间——先找准关键点再思考,token少用30%,速度快57%,效果还不输并行方法。

aarXiv cs.LG原文
模型15:05
ITSPACE:一种单调高斯最优传输更新方法

ITSPACE用闭式更新直接优化Bures-Wasserstein距离,在协方差对齐任务上比梯度下降快得多,适合资源受限的域适应场景。

aarXiv cs.LG原文
模型13:57
VLK: 通过合成交互学习人形机器人操作

想让人形机器人自己学会拿东西?VLK用48,000条合成轨迹模拟真实场景,直接在Unitree G1上跑通了导航和运输,省掉人工标注的苦力。

aarXiv cs.AI原文
模型13:55
LeVo 2:分层建模与渐进后训练实现稳定歌曲生成

LeVo 2 发布了一个能生成完整歌曲的模型,通过分层建模和美学引导训练,歌唱质量和可控性都比开源方案强,已经逼近商业系统水平。

aarXiv cs.AI原文
模型官方一手12:39
Agents-A1:35B MoE智能体模型在长视野任务上媲美万亿参数性能

35B的模型干翻万亿参数?Agents-A1用长视野扩展和智能体框架做到,基准全面领先,值得看看怎么训练的。

aarXiv: DeepSeek原文
模型11:54
Adaptive Financial Transformer 用体制门控注意力预测股票收益

要预测股票涨跌?这篇论文搞了个自适应 Transformer,把95个金融指标分成11组,根据市场风向调整注意力,还省了15%的算力。

aarXiv cs.LG原文
模型11:16
DreamForge-World 0.1 Preview:低计算实时可控世界模型预览

DreamForge-World 0.1 Preview让你在消费级显卡上实时操控世界模拟,支持键盘鼠标,15 FPS流畅运行,比那些需要超算的模型亲民多了。

aarXiv cs.LG原文
模型10:59
NMO基准:推动纳米技术分子优化的新测试

科学家们搞了个新基准NMO,专门用来测试分子优化算法在纳米技术上的表现,直接用量子模拟打分,结果发现之前的先进方法还不如简单方法好用。

aarXiv cs.LG原文
模型官方一手10:40
EMPATH:多语言审计-法官基准用于情感支持聊天机器人安全评估

这个新基准EMPATH专测情感支持聊天机器人的安全漏洞,用AI模拟求助者进行多语言多轮对话,发现主流模型评分虚高且不稳定,值得一做。

aarXiv: DeepSeek原文
模型10:15
MDM-VGB:掩码扩散模型的推理时缩放与奖励引导生成

这篇论文给掩码扩散模型加了重新掩码机制,像有个纠错开关,Sudoku和QM9上效果很好,值得做推理优化的读者看看。

aarXiv cs.LG原文
模型10:10
PEHT:参数高效混合Transformer用于网络流量预测

想用Transformer预测城市网络流量?这个PEHT用LoRA大幅减少参数,还能融合拥堵数据,实测精度超过现有方法。

aarXiv cs.AI原文
模型10:09
HAT-4D:通过人机协作从单目视频重建多物体4D交互

不用多相机,单视频就能重建多个物体怎么动,还能人工纠正错误。HAT-4D这个框架开源了,做Embodied AI的数据生成很方便。

aarXiv cs.AI原文
模型10:09
LLawCo: 学习合作法则以建模具身多智能体行为

多智能体容易各说各话?LLawCo让它们自己学会“必要时说话”“等待伙伴”,在PARTNR-Dialog和TDW-MAT上成功率都涨了4-7个百分点,挺实在的。

aarXiv cs.AI原文
模型10:08
CPAgents: 自动生成复合心脏表型提升疾病关联发现

这篇论文提出了CPAgents,用三个智能体自动组合心脏影像特征,相比传统方法在56/72测试中拿第一。适合关心AI辅助医学研究的读者。

aarXiv cs.AI原文
模型10:08
Tandem Reinforcement Learning 在 RLVR 中实现模型协同推理

他们提出了 TRL,让强模型和弱模型组队推理,强模型学会写弱模型能看懂的推理过程。训练 Qwen3-4B 后,单打能力不降,协作能力更强。

aarXiv cs.AI原文
模型10:08
CG-ICS:概念引导的鲁棒上下文分割新范式

想让模型在不同参考图下都稳定分割?试试 CG-ICS,用概念推理代替简单视觉匹配,SAM3 和 MLLM 帮你搞定。

aarXiv cs.AI原文
模型官方一手10:06
BashCoder-R1:面向鲁棒可解释Bash代码生成的框架

BashCoder-R1用三阶段训练让AI写bash脚本更稳更可解释,在BashBench上比DeepSeek-V3.2完整率高出一大截。

aarXiv: DeepSeek原文
模型10:53
E-TTS:一种具身测试时缩放框架,用于机器人操作

E-TTS团队搞了个新框架,不用重新训练就把机器人操作成功率在模拟中提33%,真实场景提26%,挺实用的。

aarXiv cs.AI原文
模型10:52
OmniAct:整合规划、记忆与验证的泛模态具身智能体框架

他们搞了个新架构,让机器人能自己协调API、物联网和物理动作,干活出错还能自己恢复,20个任务里成功率都比之前高,而且省钱省token。

aarXiv cs.AI原文
模型10:36
Analog Interaction Systems:模拟硬件上高效生成模型

模拟硬件跑生成模型能耗低两数量级,AIS框架在MNIST上FID仅27.6,比之前好3-4倍,适合低功耗场景。

aarXiv cs.LG原文
模型官方一手10:16
HyperDFlash: 面向DeepSeek-V4的MHC对齐块推测解码

DeepSeek-V4新出的HyperDFlash框架,用门控缩减和蒸馏让推测解码提速,比MTP和DFlash都厉害。

aarXiv: DeepSeek原文
模型09:48
NuclearQAv2:评估大语言模型核工程能力的结构化基准

想看你用的LLM在核工程上有多靠谱?NuclearQAv2用1240道硬核题测出模型的定量推理短板,比通用基准更实在。

aarXiv cs.AI原文
模型10:59
FORCE: 高效VLA强化学习微调框架,提升79%成功率

新框架FORCE让机器人学动作更快更稳,成功率飙升79%,比现有RL方法还快32.5%,不用人插手。

aarXiv cs.AI原文
模型10:50
SpeechEQ:为社交语音对话模型评估情感智商的新基准

SpeechEQ搞了个新基准,测AI在对话里能不能听懂语气和情绪,发现模型靠文字猜情绪,安全对齐后还变傻了。想做真情感AI的必看。

aarXiv cs.AI原文
模型10:45
后训练中被忽视的免费午餐:进度优势用于LLM智能体

这篇论文说,RL后训练时顺便就能得到一个免费的好信号,不用再费劲训练奖励模型,在好几个测试里都比专门训练的效果还好。做智能体训练的一定得看看。

aarXiv cs.LG原文
模型10:34
InvestPhilBench:评估大语言模型专家投资哲学程序推理的多层动态基准

InvestPhilBench揭示了AI在投资程序推理上的真实水平:Claude虽高分,但程序推理准确率仅0.77。别只看总分。

aarXiv cs.LG原文
模型09:38
MiniOpt: 用强化学习推理建模并解决通用优化问题

想用小型模型搞定各种优化问题?MiniOpt用3B参数就做到了不错的效果,而且代码开源随便玩。

aarXiv cs.AI原文
模型12:14
FLUX3D:扩散对齐稀疏表示实现高保真3D高斯生成

想从单张图生成高质量3D模型?FLUX3D用扩散对齐稀疏表示解决了细节丢失问题,效果比现有方法好一截,值得搞3D生成的看看。

aarXiv cs.AI原文
‹ 上一页
123…8
下一页 ›
今日全部早读东盟登录