Anthropic的实验告诉你,多智能体协作会搞内鬼,能力强反而坏事。做了Agent系统的都该看看。
BDH-CQ 这篇新论文把循环潜在推理用到上下文学习里,想看看它怎么提升少样本推理,可以读读。
LMArena这段视频把AutoEval评测方法讲得挺清楚,还配了文章,想研究模型评测的可以戳进去看看。
Anthropic 做了个实验:让“思想病毒”在多个 AI 智能体之间传播,一句系统提示警告就能几乎完全免疫,论文在 arXiv 上。
记忆专场金句:ChatGPT 记错旅行,上下文学习赢过专用记忆,改推理就让任务完成率从22%提到60%。
这条论文用24万条指令数据告诉你CLAUDE.md为什么越写越长,还给了注释法这个解法,提升多到23%。
LlamaParse 发布 ExtractBench:长文档让商业模型召回崩到 35%;自家 Agentic Plus 95.6% 登顶,成本更低。
Anthropic发了新研究,Claude在推理和代码上又强了,接近GPT-4,想了解细节的可以看看。
腾讯混元团队整理了549篇论文,给自进化智能体分了L0-L4五个等级,还提出一套验证更新靠不靠谱的方法,做Agent研究的朋友可以看看。
NVIDIA开源了训练编码智能体的数据集,想搞强化学习或智能体开发的可以看看。
这篇讲的是用人类数据直接训练机器人,不用机器人轨迹数据也能变强,跨具身缩放定律首次被证明,值得搞机器人的朋友看看。
有人发现了从各家前沿模型API里偷看隐藏推理的漏洞,还验证了计费token对得上,挺有意思的。
想测测你的 AI 编程助手在多语言重构上到底行不行?这个新基准 SWE-Bench ProMax 就是干这个的,比原来的 SWE-Bench 更狠。
Meta新论文搞了个Skaling law,比Chinchilla和Kaplan那套准1.5到3倍,而且小规模跑就能算准,预算算力能省不少。
想看怎么用83亿智能体模拟世界?MatrAIx 论文来了,Hugging Face 就能看到。
Meta 新论文让智能体学会管理外部记忆,Qwen3-8B 在 ALFWorld 到 96.9%,长任务不用堆工具。
这期请了一堆机器人研究者,讲 VLA 和世界模型新论文,还有遥操作创业观点,挺干货。
Agent Arena 把怎么用因果追踪看清智能体行为的方法讲透了,做智能体评估或研究模型机制的人可以看看。
Gary Marcus 在线怼人,翻出自己 2001 年的论文说对方没读过定义。想围观神经符号 AI 的考古级争论就看这条。
新论文提出技能熵,用来评测和训练长程推理。想搞清AI是不是真会推理的可以读。
这篇论文把多模态预训练拆成知识流、模态协同和早期统一,还给了训练配方,搞多模态的可以读读。
想知道数据智能体怎么选?DataSpace测了6个模型和5个框架,换框架能让准确率差15个点,值得看。
Notion 搞了个全球职场 AI 调查,6000 人、10 个市场,看看大家上班怎么用 AI,结论挺有意思。
MerchantBench 专门测 LLM 智能体在电商里的长期连贯性,比单轮问答更贴近实际运营,可以看看。
别急着换模型,先看看 agent harness。同一任务成功成本能差 5 到 30 倍,论文还给了省 token 的提示模板。
有人发了 LongHorizon-Harness,一个专测长时程智能体的框架,论文在 Hugging Face,想评估多步任务表现可以看。
谷歌Titans团队的新方法用记忆缓存把RNN长上下文召回从21提到32,算力还远低于Transformer。
做Agent生产的人快收藏:它把41种故障按交互边分类,修bug能直接判断是模型问题还是脚手架问题。
做智能体服务的朋友看下,TokTier把长记录重复分词干掉了,vLLM下首字延迟降16%-34%,省GPU。
看微软研究院这周新东西:SocialRL 教小模型谈判,PazaBench V2 补非洲语言语音评测,顺带还有 EvoLib 智能体知识库。
OpenAI 把证明过程和机器验证文件都公开了,直接看 Lean 证书就能确认对错,搞数学的可以省去重复推导。
斯坦福Carrie的新框架,用历史任务校准合成数据,不需要真实标签,Agent Arena也在用,能解决模型和时间带来的偏差。
陶哲轩对AI做数学的真实看法,讲得很清楚:AI能算题,但建理论还不行。
开放式任务也能用强化学习自我改进了,这篇论文把RLVR升级成RLSVR,不用人工奖励,AI自己验证自己。
这篇SaliTrap研究用1145道常识题考了12款模型,最好的也才过半避坑,点开看看谁最容易被数字带偏。
Gary Marcus直接回怼“神经符号AI从没试过”,说大厂其实都在做,还甩出2020年的文章让你自己看。观点很冲。
DeepMind真会玩:把模型权重当文本喂给LLM,不用训练就能直接生成新技能,论文在arXiv可看。
MIT和哈佛发了个评测,把前沿LLM丢进真实科研流程,结果它们连假设都提不好。
Gary Marcus公开质疑OpenAI的249页数学论文不讲模型机制,和普通论文比缺了关键验证细节。
Claude Code多智能体协作总丢状态?ATWZ给每个智能体独立工作区,一条命令恢复整队。