想测测视觉语言模型能不能真在3D空间里干活?SceneActBench给你5个任务、520个案例,开源又公平,看哪个模型分高。
全部动态
这篇论文提出HiKV,用两阶段KV缓存压缩加专用硬件,7.95倍加速、90%省电,精度几乎不掉。做长上下文LLM推理加速的可以看看。
这篇论文用了一种叫bag-of-waves的巧办法,只需少量数据就能从脑电信号里学到可解释的波形模板,比那些黑箱深度模型好懂,还省钱省算力。
这篇论文给出了一个很实用的思路:用任务级反馈来动态路由LLM,不用每次调用都做独立决策。在多个基准上同时提升了准确率和速度。
这篇论文提出了一种新方法,用凸优化来生成带图结构的关联矩阵,比GAN方法更灵活,还做了理论和实验验证。
LunarFM把三个月球任务的六种仪器数据整合成一个模型,能直接做资源识别和地质分类,开源数据集和代码。
这篇论文揭示了负移位梯度下降的谱正则化机制,能突破负脊端点的结构限制,在过参数化线性回归中实现更优的混合符号滤波。
这篇论文告诉你,艺术家也能像玩材料一样玩扩散模型内部。他们在ComfyUI做了交互工具,能直接操纵Stable Diffusion的层,看到具体变化。不是理论说教,是真能动手调的。
研究了一套专门针对 NFT 合约的漏洞检测方法,用 DeepSeek 加代码切片把准确率干到了 97.1%,比纯分析完整合约高了 23 个百分点。做合约安全的可以看看。
如果觉得 LoRA 微调大模型太费钱,κ-LoRA 只挑条件数大的矩阵来更新,参数量砍半,速度提升 16%,精度不降,值得试试。
这篇论文教你如何通过修改网页内容让大模型推荐时把你想要的东西排第一。SIREN用PAIR越狱循环,在Claude模型上成功率80%,挺有意思的。
这篇论文把Hyperball优化器的机制拆开来看,发现它并不像传说中那样自动解决学习率调度问题,掌握好调度才是关键。
想精确控制视频里多个物体的互动?GraphVid用交互图代替画轨迹,效果比Motion-I2V好很多,FID降了40%。
想用强化学习训练自己的 Claude Code 智能体?OpenForgeRL 让你在真实 harness 和环境中端到端训练,ClawEval 和 GUI 基准上表现不错,而且开源可用。
这篇论文搞了个VLM-IE3D,让普通视觉语言模型看RGB视频就能学会3D空间感,不用额外3D设备,而且好几个3D任务都做得更好。
时间序列分类的黑盒解释往往只找够用的特征,但可能抓到噪音。这篇论文提出了TimePNS,用反事实推理揪出真正必要的子序列,实验效果比现有方法好。
想知道 AI 定理证明在量子计算领域到底多强?这篇论文给了两个新基准和四个模型实测分数,LAD 方法能提升最高 15.9 分,很实在。
做分子性质预测的朋友看过来:新模型EnsembleEGNN把多个构象编码成一个嵌入,在环肽任务上比纯序列模型效果好,R²提升到0.538。
想提升音频模型的逻辑推理?这个框架用文本教师蒸馏,在MMSU等基准上效果拔群,比纯音频训练强很多。
这篇论文解决了长上下文下投机解码的瓶颈,用滑动窗口草稿省掉99%的KV读取,实测速度提升近三成,而且不损失精度。搞大模型推理优化的值得看。
这篇论文给出了高召回场景下审计遗漏量的理论基础和实用方法,适合做检索系统或数据管线的朋友参考。
TTEL能定位推理错误,只重算出错部分,省近一半计算量。Qwen3-8B在编程测试上成绩亮眼,值得关注。
这篇论文发了KroQuant,用Kronecker结构做激活变换,W4A4量化又快又准,比SVDQuant和LoRaQ结果好,还省参数。
这篇论文提出了VCSD,不需要外部老师就能让多模态模型自己教自己,在Qwen3-VL上几个规模都涨了4-5个点,而且不增加推理成本。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档