同一模型放进 Claude Code 和 Codex 跑同样的任务,结果居然会一个升一个降,这篇论文用 PowerPoint 重建实验讲清楚了 harness 的影响。
全部动态
Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
OpenAI 要下线 GPT-5.5 了,用 ChatGPT 和 Codex 的用户得赶紧换到新模型,比如 GPT-5.6 Sol 或 GPT-6 Astra。
ByteDance团队推出HarnessDev基准,首次评测LLM能否自己创建Agent执行框架,发现模型间harness迁移性极差。
研究ISAC框架,了解如何利用问题信息提升LLM生成提交信息的效果,与现有方法相比有显著提升。
Inherent新推Faraday智能体,小模型大能力,强化学习助其超越GPT-5.5与Claude Opus 4.8,值得关注。
阿里刚发了 Qwen-UI-Agent,能直接操作手机电脑屏幕,移动端比 GPT-5.6 Sol 高 12 个点,还能在真实手机上跑任务,以后帮你自动查地址、订高铁、整理文件应该更靠谱了。
这篇论文用GPT-5.5和DeepSeek实测发现,压缩上下文会让智能体反复重新查工具,任务成功率却没变。想知道为什么只看完成率会骗人,可以读读。
StateM 不改模型权重,光靠升级执行系统就把 GPT-5.6 在终端测试的准确率拉到 95.3%,成本只要 15 美元,值得看看它的思路。
OpenAI官方晒了组省钱实测:Hypha AI用GPT-5.6 Luna把文档提取成本降到1/18,准确率还保住98%;RogoAI靠工具调用省了21%输入token。
想看看AI在规则变了之后能不能自己改代码?PACE-Bench 专门测这个,目前最强的 GPT-5.5 也只解决了 Statics 子集的三分之二,离满分还远得很。
一个叫Faraday的27B智能体,把论文复现变成强化学习任务,在测试集上赢了Claude Opus 4.8和GPT-5.5,还把编码agent当工具用,有点意思。
OpenAI 的 GPT-5.6 Sol 在低推理强度下就超过了 GPT-5.5 的高推理强度表现,还更省 Token,你可以直接上手试试。
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
Jerry Liu说别急着用前沿模型做文档OCR,LlamaParse在表格图表上准确率涨了15%,还能自己搭ParseBench跑评测。
看Opus 5和GPT-5.6-Sol在同一基准上的表现,一个越强越费token,一个越强越省,挺有意思的对比。
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
马上有一场AI模型成本对比直播,看GPT-5.5和Kimi K3等10个模型谁完成任务更省钱,还能直接提问。
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…