Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
全部动态
OpenAI 要下线 GPT-5.5 了,用 ChatGPT 和 Codex 的用户得赶紧换到新模型,比如 GPT-5.6 Sol 或 GPT-6 Astra。
Inherent新推Faraday智能体,小模型大能力,强化学习助其超越GPT-5.5与Claude Opus 4.8,值得关注。
阿里刚发了 Qwen-UI-Agent,能直接操作手机电脑屏幕,移动端比 GPT-5.6 Sol 高 12 个点,还能在真实手机上跑任务,以后帮你自动查地址、订高铁、整理文件应该更靠谱了。
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…
Simon Willison做了smevals评估工具,YAML写测试,一条命令可跑GPT-5.5和Claude Opus 4.6对比,生成报告。想搭评估套件可试试。
Wiz搞了个Atlas系统,让多个AI智能体像安全团队一样协作挖漏洞,已经在开源项目找到200多个漏洞,基准测试还超过了GPT-5.5-Cyber和Claude 4.6。
微软出了个专攻安全的AI模型MAI-Cyber-1-Flash,CyberGym跑分95.95%,比Mythos 5和GPT-5.5 Cyber都强,还更省钱。
Sakana AI 新出的网络安全模型 Fugu-Cyber 在 CyberGym 上拿了 86.9%,比 GPT-5.5-Cyber 还高,做安全测试的可以关注。
Sakana AI新出的Fugu Cyber在安全基准上比GPT-5.5-Cyber还强,86.9%的CyberGym成功率很硬核,搞网络安全的可以关注。
Kimi K3在投资研究上直接干翻了GPT-5.5和OPUS-4.8,时间判断和证据边界控制尤其强,已经在AlphaEngine上用了,搞金融研究的可以试试。
Moonshot发了2.8万亿参数Kimi K3,前端代码超越Fable 5,开放权重版月底就能用,价格虽高但看齐Claude Sonnet。
Meta 的 Muse Spark 1.1 强化了多智能体协作与代码开发,支持百万 token 长上下文,但部分场景弱于 GPT-5.5 和 Claude Opus 4.8。
OpenAI又搞事情了:GPT-5.6 Sol用一句模糊指令就能自动调教出更强的Luna,性能比上一代飙升16分,自动化研究越来越近了。
想选行业AI模型?Claude Fable 5 碾压全场,但成本是 DeepSeek V4 Pro 的百倍,性能只多 12 分,性价比得掂量。
OpenAI 这次把语音交互做得更自然了,GPT-Live 系列能边听边说,还能打断和调用工具,比以前的 Advanced Voice Mode 流畅很多。
OpenAI 让 ChatGPT 能同时听和说了,复杂问题自动转给 GPT-5.5 处理,对话更自然。付费用户现在就能体验。
OpenAI 用 GPT-Live 把语音交互做到实时全双工,还能让 GPT-5.5 处理复杂推理,听说是你聊天的好帮手。
马斯克的SpaceXAI联手Cursor搞了个新模型,据说能跟GPT-5.5和Claude Opus 4.8掰手腕,可以看看。
Simon Willison 用 GPT-5.5 写了这个 Web 组件,能自动从 GitHub 链接抓取指定行的代码显示在网页上,带行号,做文档或博客嵌入代码很方便。
Simon 发布了 sqlite-utils 4.0rc3,主要加了复合外键支持,还修了一堆 issue。用上 Claude 和 GPT 帮忙,少踩不少坑。