做仓库级代码生成的可以看看这篇:FeatLens 用功能索引建图再检索,比全仓库图方法省六成节点、四成多 token,检索还不用调 LLM。
全部动态
这篇讲了怎么把智能体跑长任务的 token 开销砍一半,方法只有一条:压缩只删不改,还开源了能在 Claude Code 里直接用的实现。
一篇很实用的论文:不改模型、不改提示词,只在运行时注入失败 informed 的策略指令,GPT-5.6 跑 Terminal-Bench 的重复成功率就能涨近 10 个点,做 Agent 的可以看看。
这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。
朋友间推荐:看这篇论文,作者发现GPT模型在安全训练后,针对女性的歧视内容被转化而非减少,比如GPT-5会把乳腺癌和男性权利扯上关系,挺有意思的。
Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
朋友,这篇论文挺有意思的,它专门测试了GPT-5.1、Qwen-3-Max和DeepSeek-3.1这三个大模型在生成乌尔都语故事时的表现,发现它们在文化方面确实很弱。
Claude、GPT-5和Gemini在代码生成时加入执行约束后,代码效率大幅提升,最高快3.1倍。
Recuris模型在长时程任务中显著提升了GPT-5.6 Sol和Claude Opus 5的表现,是长时程智能体驱动的递归记忆架构的一个突破。
StepGuard 通过自动数据生成和动态平衡学习,显著提高了安全防护的准确率,同时保持了效用。与 GPT-5.4 相比,防护效果更佳,值得一看。
研究ISAC框架,了解如何利用问题信息提升LLM生成提交信息的效果,与现有方法相比有显著提升。
这篇论文评估了LLMs在语法工程中的实用性,特别是针对Cantonese ParGram资源,与GPT-5.4相比,gpt-oss-120b表现稍逊。研究有助于了解LLMs在语法工程中的优势和局限性。
Repo0通过GPT-5 mini和DeepSeek V3.2实现了更高的功能覆盖率和通过率,是设计驱动零到全代码生成的创新框架。与RPG相比,性能提升显著。
这篇论文用GPT-5.5和DeepSeek实测发现,压缩上下文会让智能体反复重新查工具,任务成功率却没变。想知道为什么只看完成率会骗人,可以读读。
StateM 不改模型权重,光靠升级执行系统就把 GPT-5.6 在终端测试的准确率拉到 95.3%,成本只要 15 美元,值得看看它的思路。
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…