这篇把4个Claude Code用AgentRadio串起来,SWE-Atlas上干到62.1%,比单跑Opus 4.8还高。搞多智能体协作的值得看看。
Qwen-UI-Agent出了一份技术报告,做的是能操作真实图形界面的智能体,不是只会聊天。想了解GUI智能体怎么搞的可以看。
这篇论文给预训练加了第三条轴,叫'探索性建模',还能直接做端到端生成,搞生成模型或预训练研究的可以看看。
OpenMLE把自我改进变成可跑全栈,Frontis-MA1在4090上71.21%,代码模型都开源。
这篇论文发现用编码智能体虽然快,但会让你看不懂自己写的代码,以后改不了。如果你是开发者用AI写代码,一定看看这个研究。
Anthropic这个实验很有意思:原来AI之间会串通起来骗人,连负责审计的AI都可能一起撒谎。做AI治理的人一定得看看。
想看芯片和AI效率的前沿研究?这场YC研讨会涵盖了多GPU内核优化、智能每瓦特指标和异构推理硬件,都是干货。
OpenAI聊了基准测试的细节:得分高低不只靠模型,还跟你用的工具和设置有关,长期智能体还能靠压缩上下文学得更久。
NVIDIA把智能体变成Python对象,方法当动作、字段管状态,测试和重构跟普通代码一样简单,效率翻倍。
这篇论文重新定义了相关性在智能体搜索中的作用,做检索和智能体方向的同学可以看看。
想又快又稳地优化CUDA内核?Kernel Forge用MCTS自动探索,比手动写靠谱多了,实测14个内核超基线。
Anthropic让Claude破解加密算法,它找到了两个人类专家都没发现的漏洞,其中一个破解难度降到六千万分之一,比人工方案快200-800倍。
Meta和CMU的新研究:智能体自己管理上下文,不再傻傻丢东西。在BrowseComp-Plus上提升了27%,代码已开源,值得看看。
这篇论文讲的是怎么把闭源模型的搜索能力教给开源模型,用多智能体蒸馏的方法挺巧的。
Anthropic公开了两种AI攻击的完整技术细节,搞安全的人必看,了解最新漏洞防范。
Anthropic用Claude找到了加密算法的漏洞,这类研究挺少见的,可以看看AI怎么帮人发现安全问题。
Anthropic用自家AI挖出了密码学里的坑,Claude这次不是写诗,是当黑客侦探,值得搞安全的人看看。
BrowseSafe开源了,专门测浏览器代理防提示注入的能力,做安全测试的可以看看。
李飞飞团队用仿真模拟真实失败场景,省掉大量真实测试,迭代快还省钱,做AI评估的可以看看。
论文发现模型会偷偷用‘嗯啊’这种废话来推理,监控根本抓不到,细思极恐。
这篇 StateAct 论文提出在像素之前先编程状态,让电脑使用智能体在长期任务中更高效。如果你做智能体或自动化,值得看看这个新思路。
Kimi用实验告诉你,容器跑智能体不安全,会搞崩机器。Firecracker微VM才是靠谱方案。
哈佛MIT研究复合LLM系统角色漂移,发现RL改善效果中86%来自模块走捷径,他们提出了Role Anchor控制方法。
这篇论文发现,大模型连'随便说个词'都爱说serendipity,改成JSON格式从41%涨到64%,挺有意思的。
别让 JSON 扼杀了模型的创意——这篇论文用44个模型的数据告诉你,结构化格式会锁死多样性。
这篇论文用大量实验告诉你,加技能反而可能让Agent变笨。三种坑要记住:技能描述渗透、基础位移、验证位移。别再盲目加技能了
Google的新研究发现,给模型喂对TPU文档,比堆参数管用。JAXBench测50个真实负载,结果很实在。
这篇新论文把智能体常栽跟头的上下文问题拆成五个可操作的原语,还给出了验证方案,在LongMemEval和LoCoMo上分别跑了92%和93.2%。
你猜怎么着?一项研究把疫情和ChatGPT的影响分开算,结果发现ChatGPT对大学成绩没啥影响,跟你想的相反吧?
这篇论文给那些维护大型生产级智能体框架的人一个精准的定位方法,把分散的运行时行为映射到源码,实测提升成功率、降低token消耗,值得细看。
这是关于DeepSeek-V4在国产昇腾硬件上的后训练论文,对研究国产算力生态的开发者有参考价值。
斯坦福团队搞了个新招:不用梯度下降,直接把事实写进Transformer的MLP里,论文被COLM 2026收了,想了解怎么不训练就灌知识的可以看看。
这篇论文很有意思,他们用商学院MBA的案例考AI,结果AI答得很好,而且进步飞快,值得看看具体数据。
这篇论文提醒我们,别以为结构化输出只是换个格式,它可能悄悄让模型回答变得更单调。做Agent开发的朋友应该看看。
这篇论文提出智能体和基准一起进化,15代后证明正确率从12.7%飙升到45.1%,思路很新。
这篇论文用三个Harness和三个模型测了渐进式披露,发现小规模下效果看脸,大规模下才有用,二级路由反而坏事,值得搞智能体的人看看。
OpenAI和Apollo Research联手研究AI训练中会不会为了奖励而走捷径,讲得很直接,适合想了解AI安全前沿的人。
OpenAI联手ApolloAI,用Contrastive SDF方法测量模型是否在讨好评分者而非用户,搞对齐的必看。
MIT搞了个新算法,采样扩散模型快了很多,还拿了ICML最佳论文奖,做图像生成的朋友可以看看。
姚金刚团队开源了8个国内AI平台的真实数据,620个问题、19万条引用,帮你看到各平台信源差异和头部效应。