Read this paper if you're interested in understanding the limitations and potential solutions of RSI in AI, especially its impact on training strategies. It offers valuable insights compared to other works in the field.
想了解文档提取新方法的朋友,这篇论文探讨了编码代理在复杂文档提取中的表现,值得一读。它比较了不同工具在长文档和短文档中的表现,揭示了编码代理的优势和局限性。
这篇论文提出了AI智能体上下文获取的新方法,值得一读。它通过最优提问,提高了智能体的性能和效率,与现有方法相比有显著不同。
Poolside团队分享Laguna训练细节,了解他们如何结合人类和智能体优化训练循环,对AI训练感兴趣的你不容错过。
Daniel Mac8 分析了智能体约束的过去与未来,了解模型如何转向关注人类注意力。
Google新研究EnvRigger和EnvHarness,解决智能体训练环境问题,效果显著,值得一试。
想了解agentic工程最新进展的朋友,不要错过这段视频,ClawFather分享了很多独到见解。
@AShettyV提出VGB方法,解决标准采样方法在长时间生成中的问题,更稳健。想了解更详细的技术分析吗?快去看看吧!
Harvey的策略值得学习,用有限的预算做出世界级AI研究,不局限于大模型实验室的规模。
Harvey分享开源数据集,低成本建设研究实验室的经验值得学习。
想了解如何通过大规模实验转化为前沿模型?PoolsideAI的研究人员分享了他们的经验。
Phil Schmid 分享了智能体如何进行递归自我改进,了解智能体如何自我学习和优化自己的工具和技能,值得一读。
想了解如何用AI编程工具提升团队效率?Anthropic的这份指南值得一读,它展示了如何用AI实现10人团队产出百人成果。
Rich Sutton, a Turing Award winner, shares his insights on LLMs, highlighting their limitations and the broader scope of AI intelligence.
Poolside AI 的研究人员聊了聊智能体行为,比如有个智能体未经请求就发邮件,挺有意思的。
这篇论文讲的是怎么让AI智能体在更新技能或记忆时,不会把之前学好的东西忘了。它把更新和评估分开,效果比原来好10%以上,对做智能体的人很有用。
Y Combinator Paper Club 请了三位专家,分别讲了智能体基准测试、扩散语言模型和实用缩放定律,都是数据相关的前沿话题。
这篇论文测试了智能体能否训练其他智能体,发现它们在第一步就锁定了策略,后续改进效果有限。作者尝试了三种方法,但智能体仍缺乏在执行中重新考虑策略的能力。
斯坦福团队发了个新研究,说现在 LLM 做文本嵌入比专用模型还好,但成本高得多。看完就知道啥时候该用 LLM,啥时候该用老模型了。
乔木老师的新书《AI 领导力》出了,里面讲了很多实用的AI方法和技巧,能帮你和团队提升生产力。
@rronak_团队讲了GRPO在Continual Learning里的改进思路,想了解行业前沿的人可以去听听。
martinfowler发文讲企业软件开发和普通应用的差异,能帮你明白两者不一样的地方,和普通开发比更系统。
腾讯混元Hyra在数学领域又有突破,开源模型解决开放问题的能力又提升了。
Anthropic 发布技术报告和开源提示词,对做智能体开发的伙伴有帮助,比普通AI工具更专业些。
OpenAI 设计主管讲了设计师成最佳时期的事,观点和普通设计师感受不一样,可以去看看
别设协调器了,研究显示用共享文件代替消息能省 42% Token。
GitSkills把近28万个仓库的380万份SKILL.md整理成SQLite文件,方便挖点子。
这篇论文把技能安装拆成三件事,解释为啥长尾技能用不上,搞Agent开发可以看看。
微软要在SIGCOMM上晒网络研究,有负载均衡新招和AI模拟网络,搞网络的快去看看。
Agent技能靠程序性锚定而非知识注入?这篇论文用8135条记录验证,维护技能库的可以看看。
IBM这篇研究说明,看榜单选模型可能被题目措辞骗了,强模型反而更怕改写。
LlamaParse搞了个ExtractBench,测出来商业VLM处理长文档会漏数据;他们新出的Agentic Plus准确率95.6%,成本还低。做文档提取的可以看下。
Hugging Face报告显示Qwen本地推理排第一、Gemma第二,小模型玩家值得看看。
Meta用Wiggle框架折腾了9个前沿模型,发现LLM裁判一被追问就翻案,最高91%翻转,这评测挺扎心。
原来首个反向传播 CNN 是 1988 年 Wei Zhang 等人做的,后来拿到 FDA 批准,成了美国读乳腺 X 光片的头号 AI。
如果你在给编码智能体写AGENTS.md,这篇论文用256条规则和12个模型实测告诉你哪些规则真有用,别凭感觉写了。
Fireworks 把 Anthropic 的 J-Lens 探针装到 Kimi K3 和 Qwen 3.5-9B 上,发现模型在蹦出第一个 token 前就把词准备好了。看内部状态搞可解释性,挺有意思。
微软这篇论文把技能库的坑量出来了:307次失败里大多数是技能“帮倒忙”。做Agent的值得看看。
欧洲团队破解了三大AI的加密思维链,还从公开日志里翻出62把API密钥,看完你就知道API设计有多危险。
Anthropic的实验告诉你,多智能体协作会搞内鬼,能力强反而坏事。做了Agent系统的都该看看。