全部动态
这篇论文帮你搞懂RL-for-LLM的并行训练策略,让DeepSeek-R1、o3这些推理模型训练不再那么烧钱。
这项研究用新方法替代了过时的脓毒症评分,能更准确预测患者预后。
LeVJEPA用简单架构实现视频预训练,大幅降低计算量,在图像和运动任务上都表现出色。
eBay新模型让商品详情页更智能,高价值商品转化率提升0.58%,电商推荐系统值得参考。
TransMeme框架解决了跨文化模因再创作的三大挑战,在中文-英文双向转换任务中表现优异。
VPP解决了长上下文LLM推理中流水线气泡问题,在保持短序列性能的同时显著提升长序列吞吐。
PAWBench首次系统评估视频生成模型作为世界模型的概率对齐能力,揭示了当前模型与理想状态间的差距。
这篇论文用经济游戏测试了四大模型家族的心智化能力,发现GPT-5能灵活调整推理深度,表现超过人类。
CorporateBench 填补了企业级大模型评估空白,用23万文档测试了5个模型在真实规模下的表现。
KnockGS能从物体动态响应中自动校准3D高斯表示的材料参数,解决了传统方法需手动指定参数的局限。
Check out this groundbreaking research where an AI agent designs machine learning algorithms for wireless resource management, achieving impressive results with lower inference cost and improved performance compared to initial architectures.
Read this if you're interested in how CGS low-rank approximation can make large-kernel CNNs more efficient for mobile devices, compared to existing methods like RepLKNet-31B.
Robust CurveMoE 在 CIFAR-100 和 ImageNet-100 数据集上显著提升了混合专家模型的鲁棒性,比最强基线提高了 2.37% 和 2.13% 的联合准确率,值得一试。
CardioFusion-AI通过融合ECG和PPG信号,在信号退化下提供更可靠的生理监测,与现有方法相比,其性能更优。
VBVR-Pro提供了可验证的奖励评分器,使原生视觉推理变得可训练、可验证、可优化和可实验控制,是进行视觉推理研究的强大工具。
Read this if you're interested in the latest advancements in MU-CPT and how to improve cross-modal learning in MLLMs without supervision.
MyoMechanix通过多模态感知和结构化表示,在技能活动理解和指导方面取得了突破,为健身、康复、医疗和机器学习领域的物理AI应用提供了新的解决方案。
这篇论文展示了如何利用稀疏自编码器在ν中微子基础模型中寻找可解释的潜在表示,这对于理解模型的内部工作原理和设计下游任务非常有帮助。与传统的方向头相比,这种新的不确定性头在预测角重建误差方面表现出色。
PPE通过智能数据选择和基础模型嵌入实现自主地理空间预测,在多个领域表现优于现有模型,降低行星规模分析的技术门槛,值得一看。
想了解智能体在机器学习开发中的局限性?TraceML分析了134场Kaggle竞赛中的人类和智能体工作轨迹,揭示了智能体在数据工作、验证、模型更改和集成等方面的不足,值得一读。
这篇论文提出了一个名为ICON分解的新方法,用于更准确地评估深度神经网络中各个概念的重要性,对于模型审计和可解释性研究具有重要意义。与现有的基线方法相比,它能够提供更可靠的解释,对于理解模型的决策过程非常有帮助。
Read this paper if you're interested in how AI can prevent planning failures in autonomous driving by anticipating intent divergence and using a gating mechanism.
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档