这篇论文解释了为什么最近万亿参数模型(比如Nemotron、Kimi、Qwen)能又大又好——Gated Delta Networks混合了Mamba和注意力,效率翻倍还不掉精度。
全部动态
AI 相关资讯全量信息流
7月21日
论文13:00
解读Gated Delta Networks:为何大模型参数能上T且质量好Anthropic论文揭示LLM全局工作空间:思维链与steering向量的可解释机制
Anthropic这篇论文把思维链和steering向量的工作机制讲透了,告诉你什么时候推理是真起作用,什么时候只是马后炮。搞可解释和推理的都该看看。
7月20日
7月18日
7月17日
AI协助解决统计学开放问题:GPT-5.6证明BH过程无法控制FDR
AI真的在推动数学进步了:GPT-5.6只用90分钟就找到了统计学里一个经典开放问题的反例,而5.5版本折腾20小时都没搞定。这篇报告值得所有关心AI科研能力的人看。
Stanford AI Lab论文俱乐部:AI硬件与效率讨论
这次论文俱乐部聊了ParallelKittens和Intelligence Per Watt,都跟AI计算效率相关,适合关注推理硬件的朋友。
7月16日
GPT-5.6 Sol Pro解决统计学重要开放问题:BH程序在相关数据下无法控制FDR
AI帮你揭开了统计学25年的难题:GPT-5.6 Sol Pro用90分钟证明BH方法在相关数据下会失效,比人类20小时还准。
7月15日
论文19:05
微软AI Futures Nature Health论文:Copilot为医疗信心低人群提供支持Nature Health发了微软AI团队的研究,他们看了109国170万次对话,发现Copilot对医疗系统信心低的人特别有帮助。
Perplexity AI发布WANDR:智能体实体发现与事实验证评测基准
Perplexity AI搞了个新评测WANDR,专门看智能体能不能找到一堆实体并核实每个的具体信息,比单一评分更清楚哪里不行。
7月14日
7月13日
7月11日
7月10日
7月9日
Google DeepMind论文《From AGI to ASI》探讨AGI到ASI四种路径
Google DeepMind这篇论文把AGI到ASI的四种路径拆解得明明白白,递归改进和多智能体集体两条线特别值得关注。
7月8日