Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
全部动态
OpenAI 要下线 GPT-5.5 了,用 ChatGPT 和 Codex 的用户得赶紧换到新模型,比如 GPT-5.6 Sol 或 GPT-6 Astra。
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
Jerry Liu说别急着用前沿模型做文档OCR,LlamaParse在表格图表上准确率涨了15%,还能自己搭ParseBench跑评测。
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…
Simon Willison做了smevals评估工具,YAML写测试,一条命令可跑GPT-5.5和Claude Opus 4.6对比,生成报告。想搭评估套件可试试。
OpenAI 让 ChatGPT 能同时听和说了,复杂问题自动转给 GPT-5.5 处理,对话更自然。付费用户现在就能体验。
Simon Willison 用 GPT-5.5 写了这个 Web 组件,能自动从 GitHub 链接抓取指定行的代码显示在网页上,带行号,做文档或博客嵌入代码很方便。
Simon 发布了 sqlite-utils 4.0rc3,主要加了复合外键支持,还修了一堆 issue。用上 Claude 和 GPT 帮忙,少踩不少坑。
NVIDIA 开源了这个工具,让 AI 代理能直接调用分子模型做药物发现。用上它任务完成率翻倍还省 Token,做生物计算的同学可以试试。
OpenAI 的 Daybreak 现在不仅能找漏洞,还能自动打补丁了,连 Linux 内核和 FreeBSD 都支持,安全团队可以试试 GPT-5.5-Cyber。
OpenAI 搞了个 Daybreak 扩展,直接在 Codex 里修漏洞,还有专门的安全模型 GPT-5.5-Cyber,想帮安全团队快速打补丁。
OpenAI出了Daybreak工具,用Codex Security自动找漏洞,GPT-5.5-Cyber帮你验证修复,搞安全的可以看看。
Cloudflare 这招挺实用:免注册部署 Workers,60 分钟内自动回收,很适合临时测试或 AI agent 调工具。
Apodex能派150个Agent跑15000步帮你深挖问题,自主校验结果,在Benchmark上超了GPT-5.5和Claude-Opus。
Simon Willison 发布的 datasette-agent 新版本让你可以安全地用自然语言操作数据库,写操作需要你点头,还能用 --unsafe 一键自动批准,适合快速原型。
基准测试更新直接影响了主流编程智能体的排名,做 AI 编程工具选型或评估模型能力的开发者值得关注——Claude Fable 5 新登顶,Codex 也大幅提升,建议点开看具体得分和对比。
Datasette 用户终于有了直观的 API 探索工具,Fable 5 和 GPT-5.5 的协作让理解 JSON extras 变得简单,做数据 API 开发的人可以直接试试这个工具。
做性能优化或高精度代码重构的开发者值得关注——Fable 5在聚焦任务上能突破人类极限,但日常开发用GPT更划算,看完能帮你选对工具。
对于想探索 AI 落地场景的创业者、设计师和农场主,这 10 个案例直接展示了 GPT-5.5 如何解决真实业务问题,建议收藏并尝试复现。
做全栈或跨平台开发的团队,如果被难复现的 bug 和平台适配折磨,可以看看 Nextdoor 怎么用 Codex 提效——直接复用他们的思路,能省下大量调试时间。
想对比主流模型在真实任务中的智能体能力?Agent Arena 用 30 万+任务和 200 万+工具调用给出了量化排名,做 AI 应用选型的团队可以直接参考排行榜做决策。
FrontierCode 把 AI 编程评测从「能跑就行」升级到「能合并才算数」,做代码质量评估或 AI 编程工具的团队值得关注——它暴露了当前模型在真实代码审查中的致命短板。
Boris Cherny 的 5 条建议直击长时自主运行的痛点,做自动化任务编排的开发者可以直接套用到 Codex 或 GPT-5.5 上,尤其是端到端自我验证这条能帮你省下大量无效 token 消耗,值得收藏实践。
Agent Mode 让 AI 智能体从聊天走向真实工作,做自动化、开发或研究的团队可以直接上手测试前沿模型的实际表现,还能影响排行榜排名,值得一试。
Arena 的 Agent Mode 让开发者能直接对比主流模型在真实复杂任务上的表现,做智能体应用选型的团队值得亲自上手测试,结果会直接影响排行榜。
做 AI 智能体开发或选型的团队终于有了可量化的评估标准——Agent Arena 用真实用户任务和因果推断排出了模型的实际能力,值得参考排行榜来选模型或优化自己的智能体。
Agent Arena 用真实任务数据解决了智能体评估难的问题,做 AI 智能体开发或选型的团队可以直接参考排行榜和会话信号,比纯基准测试更有说服力。
Arena 的 Agent Mode 让开发者可以直接对比前沿模型在真实任务中的表现,做 AI 评测或选型的团队值得一试。