这篇论文对Hugging Face上近十万个模型的文档完整性做了大规模分析,发现很多模型缺少许可证、局限性和环境信息,对想了解开源模型供应链透明度的朋友很有参考。
全部动态
这篇论文用QQ等式定量审计LLM的顺序效应,还给出了理论机制和实用流水线,适合对模型行为一致性感兴趣的人读。
这篇论文系统测试了用SWE-trajectory数据微调Qwen2.5-Coder时,不同轨迹筛选方法的效果,发现数据质量和数量在不同规模下影响不同,值得参考。
这篇论文发现Transformer学算术的方式跟人很像,用教人算术的策略来调模型,效果还真不错,想了解LLM推理机制和可解释性的话值得一看。
这篇论文告诉你如何微调Whisper搞定低资源语言阿萨姆语的语音识别,效果比零样本好一大截,WER直接降了78%
这篇论文把MoE模型卸到边缘设备上跑,靠专家相似性分组减少跨服务器通信,实测延迟和流量都降了,质量只掉一点。
用微分几何重新理解Transformer,给出了注意力机制是薛定谔桥、SGD是违反细致平衡的伊藤扩散等新视角,并有大模型实测验证。
这篇论文提出了ThRIve方法,用低秩适应应对PIM芯片的热噪声问题,在保持精度不变的前提下把能效提升了5.4倍,做硬件推理的值得看看。
这篇论文提出了Otap,一个用最优传输来评估Agent轨迹的新方法。它不再只看任务成功与否,而是分析执行结构,还能容忍不同的规划顺序和冗余步骤。
这篇论文用严格实验告诉你,LLM在约束推理上的表现和求解器难度不是一码事。他们控制密度、比较两类公式,发现准确率差距和求解器冲突量几乎不相关,甚至反着走。
这篇论文用严格的统计方法告诉你:CUA的修复效果不能只看单次跑分,一个看起来不错的改进有三分之一可能是错的。做AI agent的都应该看看这个库。
这篇论文展示了PagedWeight方法,能在MoE模型服务里动态量化权重,省内存还保准,比之前的方法效果明显更好。
这篇论文提供了一种利用热力学原理做机器学习的新思路,特别适合关注低功耗计算硬件的读者,从理论到超导电路实验都有。
这篇论文用PEARL方法解决了RL在复杂动力学系统中样本效率低的问题,能在非稳态流中做实时控制,比现有算法更高效,值得搞控制或RL的人看看。
这篇论文提出PRISA,用路边LiDAR自动学习轨迹预测,无需人工标注就能在边缘实时评估碰撞风险,延迟仅194毫秒,已在真实路口跑通。
这篇论文展示了生成模型能从原始对撞数据中自动学习标准模型的结构,不需要模拟样本,连共振峰和质量都能自己学到。
这篇论文挖出了智能体共识的一个坑:老实但推理错误的验证器照样能搞砸安全性。用e_δ和u_ε两个指标量化风险,比传统BFT更接地气。搞Agent基础设施的值得一读。
这篇论文用 P2L 方法从 400 个场景里只挑 2 个就搞定了 MPC 校准,风险界才 4.8%,而且置信度极高,做控制的人可以看看。
这篇论文测了11个开源模型做漏洞结构化的效果,Gemma-4-31B和Codestral-22B组队挺有意思,做安全情报的可以看看F1分数。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档