Recuris模型在长时程任务中显著提升了GPT-5.6 Sol和Claude Opus 5的表现,是长时程智能体驱动的递归记忆架构的一个突破。
全部动态
StepGuard 通过自动数据生成和动态平衡学习,显著提高了安全防护的准确率,同时保持了效用。与 GPT-5.4 相比,防护效果更佳,值得一看。
研究ISAC框架,了解如何利用问题信息提升LLM生成提交信息的效果,与现有方法相比有显著提升。
这篇论文评估了LLMs在语法工程中的实用性,特别是针对Cantonese ParGram资源,与GPT-5.4相比,gpt-oss-120b表现稍逊。研究有助于了解LLMs在语法工程中的优势和局限性。
Repo0通过GPT-5 mini和DeepSeek V3.2实现了更高的功能覆盖率和通过率,是设计驱动零到全代码生成的创新框架。与RPG相比,性能提升显著。
这篇论文用GPT-5.5和DeepSeek实测发现,压缩上下文会让智能体反复重新查工具,任务成功率却没变。想知道为什么只看完成率会骗人,可以读读。
StateM 不改模型权重,光靠升级执行系统就把 GPT-5.6 在终端测试的准确率拉到 95.3%,成本只要 15 美元,值得看看它的思路。
想看看AI在规则变了之后能不能自己改代码?PACE-Bench 专门测这个,目前最强的 GPT-5.5 也只解决了 Statics 子集的三分之二,离满分还远得很。
这篇论文用 QuoteBench 拆穿了只看匹配分数的假象,原来 GPT-5.6-sol 的分数是负 64 和正 60 抵消出来的,部署配置一变排名就翻,评估编程智能体前该看看。
想知道中国大模型是不是都一个样?这篇论文用囚徒困境测了DeepSeek、Qwen、Kimi和GLM,发现它们合作倾向差别挺大,别再把它们当铁板一块了。
Video-DR 让 AI 边看视频边上网核实信息,35B 参数干翻 Claude-4.5-Sonnet,还开源了,值得试试。
让GPT-5.4、Gemini 3.1和Claude 4.6评审300篇ICLR论文,发现它们能区分录用和拒稿,但分不清oral和poster,Gemini给分偏高。用AI审稿前先看看这个。
arXiv 新论文做了个 Ledger 层,给编码智能体记账执行状态。GPT-5 mini 在 SWE-bench 从 56.2% 提到 64.2%,成本降 28.9%。
生命科学智能体可以直接用自然语言查文献了,EMBL AI Librarian在LitQA2上比网页搜索高8分,代码已开源。
这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。
这篇论文研究了AI模型评估结论过时的速度,发现模型发布后近一年结论可能已失效。如果你做AI评测或读评测报告,它能帮你判断证据是否还新鲜。