这篇论文指出了现有offline RL治疗推荐研究可能不靠谱,因为协变量平衡诊断不够用,搞因果推断的人可以看看。
想用少量数据从工程系统里找出简洁的动力学方程吗?这篇SINDy教程有完整代码和两个真实案例,比黑箱神经网络好理解得多。
这篇论文发现OpenAI的GPT-2检测器对自闭症写作者有统计上显著的偏见——误判率虽低但差异存在。如果你关心AI公平性,值得看看。
新基准 MM-IssueLoc 专门测模型到底有没有用截图这类视觉证据,而不是全靠文本猜。当前最强系统得分才三十多,说明视觉定位远没解决。
这篇论文提出一种结合LLM和专家验证的抑郁症标注框架,能自动生成符合DSM-5-TR标准的推理轨迹,减少人工修订。适合研究可解释AI和心理健康数据标注的人。
这篇论文给扩散语言模型加了个策略梯度法子,数学推理和编程测试成绩都刷了新高,搞RL训练模型的可以看看。
想了解怎么让GUI智能体更可控?这篇论文讲了Plover系统,能把内部计划展示出来让你改,实验证明能修好很多翻车案例,比黑箱靠谱多了。
这篇论文用大量模拟数据告诉你,当前AI基准里的IRT方法可能不可靠,尤其模型少项目多时,别盲目信排名。
一种新的Transformer改进:只改中间20%的层加个循环机制,就能让模型推理更持久,而且可以直接改装现有模型不用从头训。
这篇论文用49道题测了Gemini、GPT-4等6个模型对科学图表的理解力,发现Gemini最强但人类平均还是更高,开源模型差距明显,想了解模型真实视觉推理能力可以一读。
临床医生亲自设计的AI安全测试,能精准定位模型在哪类医疗错误上出问题,搞医疗AI的必看。
这篇论文分析了AI如何把科研从手工艺变成流水线,还举了Genesis项目的例子,提出了七个扎心问题,比如同行评议会不会被机器淹没,读了对AI和科学的关系会有新认识。
这篇论文把仿人机器人控制的缩放问题拆解清楚了:Humanoid Transformer配合特定训练范式,让MPKPE直接降了82%,比现有控制器强一大截。
这篇论文发现DreamerV3等模型在Pong里会弄丢球,他们用CGSReg方法修了一部分问题,做强化学习的可以看看。
这篇论文提出NIFA架构,用ACAM替代ADC省掉70%面积和功耗,让FPGA跑Transformer能效提升近2倍,CNN更是飙升40倍。
Qwen3-8B长上下文微调显存不够?HGA方案在16GB卡上跑16384令牌,比密集训练省显存还快一点,代码正在路上。
这篇论文用LLM智能体模拟政党结盟谈判,设计了MILT和CIS两个新指标来追踪条款来源和影响力,在比利时选举数据上验证了有效性,对政治学和AI研究都很有参考价值。
研究报纸结构理解的,有开源Tiramisu代码和新数据集,对文档数字化领域很实用。
脑科学研究有多繁琐你懂的,BrainPilot开源出来帮你自动查文献、做分析、防编造,性能不输顶级框架还省钱。
这篇论文从网络价值理论出发,推导出智能体协作的最优协议,发现廉价模型合作反而能胜过单一强模型,结果很反直觉,值得读。
这篇论文提出了一个叫ArtSplit的讨论工具,帮你理解AI协作创作时所有权到底该归谁,跟艺术家们聊了聊,发现简单量化行不通。
这篇论文用Claude Code和OpenAI Codex实测了记忆注入攻击,发现一旦恶意指令写入记忆,后续会话都危险,搞AI安全的一定要看看。
这篇论文讲AI会偷偷按自己价值观答题,比如Claude对自己公司更友好。想知道你的助手是否悄悄偏袒谁?值得一看。
OpenAI的o4-mini做大学物理题整体准,但看图题就露馅了,准确率从96%掉到79%。
DriftWorld 能让机器人快速想象动作结果,比扩散模型快 17 倍,还能离线评估策略,性能强又省时。
用DINOv2-Small做MCI筛查,只训1.19M参数就比ResViT好,还自带可解释性,做医学影像分析的可以看看。
这篇论文提出了cGAP,一个新框架,用HOMALS加热图来可视化高维分类数据,特别适合基因、生物医学等领域。能保持原数据矩阵,同时揭示聚类和结构。
这篇论文提出了SMC-ES,把进化策略和统计模型检查结合起来,能生成带形式安全证明的控制策略。比普通RL更靠谱。
新论文用语义感知对比学习解决医学影像的假阴性问题,在脑肿瘤分类上AUC涨了22.6%,值得搞多模态医疗AI的人看看。
这篇论文用多轴Max@K强化学习,让T2I模型生成更公平多样的人像,公平分提升0.23-0.36,不牺牲质量。
LongStraw 能让你在固定 GPU 预算下做百万 token 级别的强化学习后训练,比现有 256K 的方法多处理 8 倍上下文,而且内存增长极低。
这篇论文用严格理论证明和实验验证了整流流中自蒸馏的改进方法,想了解生成模型自训练优化的可以看看。
MOJO让神经解码模型也能用大量无标签数据,比纯监督学习更强,尤其数据少时效果拔群。
MetaPerch通过引入元数据作为辅助信号,让生物声学模型学会了更多环境关联信息,在多个数据集上比现有模型更强。
这篇论文点出了一个关键问题:AI生成文本的优化可能走偏了,不只是工程进步,还牵扯价值观判断。适合想理解技术背后隐患的人。
这篇论文用Evo 2搞生物安全筛查,探针测耐药基因最高准到0.977,比自编码器靠谱还不用重训练。
Lighthouse RL用巧妙的‘灯塔’重置点大幅提升电路优化效率,样本快1.72倍,成功率拉满到100%。搞硬件优化的千万别错过。
这篇论文用Lyapunov指数做奖励,让强化学习不仅复现了Kapitza摆,还找到了更稳的竖直不倒方案,挺有意思。
想解决Agent长程任务奖励稀疏问题?看TRACE方法,无需额外批评器,用TD变化给每步打分,Qwen3在BrowseComp-Plus上从7分直接跳到35分。
这篇论文用EB-VAE同时预测肿瘤体积变化和患者脱落时间,还整合了基因信息,比传统模型更灵活,在黑色素瘤和乳腺癌数据上验证有效。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。