用验证器帮语言模型修量子场论对偶声明,效果不错,deepseek-chat提升8个百分点,qwen-plus提升7个百分点,值得关注。
全部动态
这篇论文提出了HyGAE方法,让VLM智能体在多个回合的决策任务里表现更好,平均成功率91%,比别的方法高了10%,值得搞强化学习和多模态的研究者看看。
这篇论文发现了世界模型选动作的隐性陷阱:候选越多反而越容易选错。ASAR用相邻集合重建的方法,在75个机器人任务上提升了最多28%的成功率,值得搞机器人控制的看看。
想提升VAE解纠缠又不想牺牲重建质量?这篇论文用软约束同时搞定,dSprites上FactorVAE得分刷到0.891,值得看看。
这篇论文用表格Q学习做分布式无人机轨迹规划,在200辆车场景下效果逼近集中式深度强化学习,还省带宽省电,值得一看。
这篇论文教你用分层SAC解决稀疏奖励的长期任务,比普通SAC成功率更高,代码已开源。
这篇论文用数据证明印度语言在LLM中平均被吃掉8倍token,马来语更高达13倍,还分析了原因和修复方向,做多语言应用的朋友值得看看。
这篇论文研究了AI模型评估结论过时的速度,发现模型发布后近一年结论可能已失效。如果你做AI评测或读评测报告,它能帮你判断证据是否还新鲜。
这篇论文用数学公式解释了LoRA微调为什么会破坏模型原有知识,而且实验覆盖了9000多层,结果很扎实。如果你做LoRA微调,能帮你预测什么时候会出现遗忘。
这篇论文教你用历史A/B数据+生成模型筛选创意,50臂实验最高提升45%,比人类写的强很多。
这篇论文告诉你,当数据标签很少时,用半监督异常融合比复杂神经网络更靠谱。AAMSF在沪深300上AUC达0.68,而且发现英文新闻反而干扰预警。
想在不牺牲太多性能的前提下给贝叶斯神经网络加差分隐私?这篇论文的DP-IVON-Gradsq方法在CIFAR-10上中低隐私保护时表现不错,兼容Adam效率,值得一看。
这篇论文在开源数据剖析工具 Desbordante 里加了概率函数依赖发现,对比了传统近似依赖,做数据清洗的话可以看看具体差异。
这篇论文给AI Agent授权画了一条红线,解释了为什么进化后的Agent可能不是你原来授权的那个,以及如何用固定上限保证安全。做Agent框架的值得一看。
这篇论文用大量实验告诉你,给Agent加技能可能适得其反。它揭示了三个具体原因,并指出减少回归比堆砌技能更重要,值得每个开发者读一读。
这篇论文用四个主流模型实测了伪科学评估,发现Grok的Fast版本评分奇高,而且同一个模型API和Web结果差十几倍。看完你就知道模型答案多不可靠,值得所有AI用户看看。
这篇论文用MineValiCoder框架搞定代码生成不可靠问题,HumanEval跑出96.34%通过率,比之前的方法强一截,搞LLM代码的同学值得看看。
这个框架能自动设计量子化学电路,比传统ADAPT-VQE快10倍,还在真实量子计算机上跑了实验。搞量子计算化学的可以看看。
看看教育者和学生如何通过三场对话,发现LLM辅助编程学习中课堂上看不见的东西,比猜学生用AI干什么有意思多了。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档