DriftWorld 能让机器人快速想象动作结果,比扩散模型快 17 倍,还能离线评估策略,性能强又省时。
MetaPerch通过引入元数据作为辅助信号,让生物声学模型学会了更多环境关联信息,在多个数据集上比现有模型更强。
这篇论文用原子动作来编舞,比直接生成连续动作更可控,效果也更自然,做AI舞蹈生成可以看看。
HealthClaw能记住你的健康习惯和变化,测试中准确率从0.2%飙到45.7%,还更保护隐私,开源可用。
手机上跑智能体不用再模拟点击了,PalmClaw直接调用摄像头、传感器等设备功能,速度快94%,值得试试。
这篇论文提出了一个聪明的点子:让注意力机制像人一样,在关键地方用更多计算资源,其他地方粗略处理。复杂度降低但精度不降,做推理优化的同学可以关注。
ATACOM-DC改进了安全强化学习,通过方向性约束只在必要时限制动作,比普通方法探索更高效。
Qwen3微调模型在化学机理推理上直接击败了专用FlowER,准确率从5.1%提升到8.3%,化学和AI交叉领域值得一看。
NeuralActuator 让几百块的机器人也能感知外力,不用额外传感器。它缩小了仿真和现实的差距,还能提升模仿学习效果。
药物筛选老难题,量子版QSVM直接拿AUC从0.80干到0.875,比传统梯度提升强了近9个点,搞药化的人值得看看。
这篇论文把Bandit PCA的遗憾上界从O(d√(rT log T))降到O(r√(dT)),下界也提到Ω(r√(dT)),彻底解决了这个优化问题的理论最优性。
ZoRRO 不用训练就能做新闻推荐,速度比深度学习模型快 600 多倍,点击率还差不多,特别适合大规模部署。
这基准测试了LLM在科学计算成像编程上的真实水平,发现它们在算法选择和物理建模上容易出错,挺有参考价值。
金融欺诈检测的老大难问题有了解法:Semantic Pareto-DQN 不用重采样,直接多目标优化,既能抓到欺诈又少误拦正常交易。
ALICE用聚合蒸馏把8个专家模型塞进一个骨干,在96个病理任务上拿了最佳平均分,还开源了代码。
NVIDIA 实验室提出 ARDY,能实时生成高质量人体运动,支持文本+约束控制,比传统方法更可控、更快速。
这个框架用Gossip历史做共识,不用区块链,训练质量不差还能抗恶意节点,适合想搞去中心化联邦学习的人看看。
想省显存又不想损失太多模型质量?BiSCo-LLM用二进制球面编码把LLM压到2比特,不用查码表,存储更省。
Infinity-Parser2 用多任务强化学习搞定文档解析,开源了500万样本数据集,Pro版在OCR基准上刷新纪录,Flash版速度快3倍多。适合做文档智能处理的开发者。
他们搞了个带记忆的 8B 多模态智能体,20 轮对话检索准确率 91.4%,比 32B 模型还快一半。代码和 demo 都开源了,值得看。
这篇论文发布了SciReasoner,一个能同时处理蛋白质、小分子和晶体的推理模型,在67项基准上成绩最好,专家评价也很高。
CO-LMLM用360M参数打平gpt-4o-mini,事实准确度比Claude还高,这是用更小模型做更好知识检索的路线。
想训练医学多模态模型但缺高质量数据?MedPMC从610万篇论文里筛出1100万对数据,效果比现有数据集好5倍。
多跳知识图谱问答一直难在中间节点没语义关联,RSF-GLLM用循环软流解决了这个瓶颈,比那些全靠LLM暴力推理的更快更准。
VAORA 用一个巧妙的奖励设计,让 VLM 在物理推理中不再瞎想,在 PHYRE 和 Virtual Tool 上泛化能力更好。
FreqDepthKV在长上下文推理中将KV缓存压缩3.9倍,同时保持任务精度,比此前压缩方法更稳定,适合内存受限场景。
GraphBU用图原生块单元生成MILP实例,能保持源图结构,可行性高,还能提升下游训练效果。
这个框架在BioASQ 14b比赛里factoid子任务拿了第一,针对不同问题类型用不同推理策略,很实用。
想了解用非英语自然语言写代码任务的基准?RuBench用俄语从真实提交中挖了25个任务,还抓到了模型被悄悄替换的证据。
TopoBrick不用训练就能预测建筑传感器数据,靠知识图谱和智能采样选变量,比很多基础模型还准,跟专门训练的模型差不多。
想用轻量模型做好内容安全?DT-Guard靠训练时推理、运行时只打标签,4B就干掉8B的护栏,速度快还准。
DeepSeek-V4搞了个新框架DSpark,把生成和验证分开调度,用户实际体验加速60%到85%,还不会拖慢系统吞吐。
阿里DAMO Academy开源的CamVLA,机器人不用提前知道相机位置也能适应视角变化,单张RGB图像搞定,部署更灵活。
Cortex把长程操作拆成32个标准动作,用开放数据自动训练,比纯VLA模型在Libero和RoboTwin上高3-4%,还能零样本做化学实验。
运筹学问题用自然语言描述就能自动建模生成代码,OptiAgent在多个基准上SOTA,迭代自纠正机制很靠谱。
这篇论文提出了CNeVA,能在Waymo数据集上仿真交通,并且沿速度、加速度等轴直接操控行为,比纯模仿模型多了可控制性,做自动驾驶仿真的可以看看。
这篇论文的Exformer模型专门处理时间序列中的极端事件,比如洪水,比普通Transformer在3天预报上表现更好。
想省电又怕买错GPU?WattGPU用公开数据就能预测新GPU和新LLM的功耗和速度,不用自己跑实验,误差才几个点。
PAW让模糊函数(如日志告警、修复JSON)不再依赖大模型API。用4B编译器一次编译,0.6B小模型就能跑出32B的效果,还省内存和算力。
ReContext不用训练就能让模型用上长文里的关键信息,Qwen3和Llama3上都有效,适合处理超长文档推理。