全部动态
这篇论文用数学公式解释了LoRA微调为什么会破坏模型原有知识,而且实验覆盖了9000多层,结果很扎实。如果你做LoRA微调,能帮你预测什么时候会出现遗忘。
这篇论文教你用历史A/B数据+生成模型筛选创意,50臂实验最高提升45%,比人类写的强很多。
这篇论文告诉你,当数据标签很少时,用半监督异常融合比复杂神经网络更靠谱。AAMSF在沪深300上AUC达0.68,而且发现英文新闻反而干扰预警。
想在不牺牲太多性能的前提下给贝叶斯神经网络加差分隐私?这篇论文的DP-IVON-Gradsq方法在CIFAR-10上中低隐私保护时表现不错,兼容Adam效率,值得一看。
这篇论文在开源数据剖析工具 Desbordante 里加了概率函数依赖发现,对比了传统近似依赖,做数据清洗的话可以看看具体差异。
这篇论文给AI Agent授权画了一条红线,解释了为什么进化后的Agent可能不是你原来授权的那个,以及如何用固定上限保证安全。做Agent框架的值得一看。
这篇论文发现,大模型连'随便说个词'都爱说serendipity,改成JSON格式从41%涨到64%,挺有意思的。
这篇论文用大量实验告诉你,给Agent加技能可能适得其反。它揭示了三个具体原因,并指出减少回归比堆砌技能更重要,值得每个开发者读一读。
这篇论文用四个主流模型实测了伪科学评估,发现Grok的Fast版本评分奇高,而且同一个模型API和Web结果差十几倍。看完你就知道模型答案多不可靠,值得所有AI用户看看。
这篇论文用MineValiCoder框架搞定代码生成不可靠问题,HumanEval跑出96.34%通过率,比之前的方法强一截,搞LLM代码的同学值得看看。
看看教育者和学生如何通过三场对话,发现LLM辅助编程学习中课堂上看不见的东西,比猜学生用AI干什么有意思多了。
想测测视觉语言模型能不能真在3D空间里干活?SceneActBench给你5个任务、520个案例,开源又公平,看哪个模型分高。
这篇论文提出HiKV,用两阶段KV缓存压缩加专用硬件,7.95倍加速、90%省电,精度几乎不掉。做长上下文LLM推理加速的可以看看。
Google的新研究发现,给模型喂对TPU文档,比堆参数管用。JAXBench测50个真实负载,结果很实在。
这篇论文用了一种叫bag-of-waves的巧办法,只需少量数据就能从脑电信号里学到可解释的波形模板,比那些黑箱深度模型好懂,还省钱省算力。
这篇论文提出了一种新方法,用凸优化来生成带图结构的关联矩阵,比GAN方法更灵活,还做了理论和实验验证。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档