Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
全部动态
OpenAI官方晒了组省钱实测:Hypha AI用GPT-5.6 Luna把文档提取成本降到1/18,准确率还保住98%;RogoAI靠工具调用省了21%输入token。
一个叫Faraday的27B智能体,把论文复现变成强化学习任务,在测试集上赢了Claude Opus 4.8和GPT-5.5,还把编码agent当工具用,有点意思。
OpenAI 的 GPT-5.6 Sol 在低推理强度下就超过了 GPT-5.5 的高推理强度表现,还更省 Token,你可以直接上手试试。
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
看Opus 5和GPT-5.6-Sol在同一基准上的表现,一个越强越费token,一个越强越省,挺有意思的对比。
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
马上有一场AI模型成本对比直播,看GPT-5.5和Kimi K3等10个模型谁完成任务更省钱,还能直接提问。
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…
OpenAI公布新数据,每周3亿人用ChatGPT问健康,还出了GPT-5.6 Sol专门优化复杂问答,免费用户也能体验升级。
Kimi 新模型 K3 跑分赢了 Opus 4.8 和 GPT-5.5,2.8 万亿参数还带百万上下文,解码快到飞起,技术细节值得细看。
Kimi K3 Max在三个内部知识工作基准上全面超过Claude Opus和GPT-5.5,适合关注智能体工作流的人看看。
以后看模型排名不只凭喜好,还能按事实准确性排序。GPT-5.5 狂飙 13 名,Claude 也被挤到第二,快去 Arena 开开关看看。
看谁家搜索模型最靠谱?GPT-5.5-search 刚拿了事实性第一,GPT-5.2-search 飙升到第三,Claude 和 Gemini 反而掉了。
别被百万token的噱头骗了!这位工程师用GPT-5.5的数据告诉你,上下文越长准确率反而暴跌,真正的解法是持续学习和真实环境训练。
别被百万token的宣传忽悠了,GPT-5.5实际测试256k时准确率80%,拉到100万直接掉到36%。这不只是容量问题,是模型推理跟不上了。
OpenAI 的 GPT-5.6 Sol 在 Agent Arena 上冲到第2,离 Claude Fable 5 更近了。看看具体指标差异,特别是用户满意度的信号。
OpenAI的GPT-5.6 Sol在Agent Arena上冲到第二,比前代进步明显,和Claude Fable 5差距缩小了,想看看真实任务中模型表现的话值得关注。
OpenAI新模型GPT-5.6 Sol在网页设计评测中拿了第一,比上一代强很多,还比Claude Fable 5更快。想看看AI设计的新天花板吗?
Muse Spark 1.1在Agentic任务上声称能追上GPT-5.5,还能直接用Meta API调用,挺有吸引力。
OpenAI发了GPT-5.6-sol,代码能力直接冲到第一,还比Claude便宜一半,搞前端开发的可以试试。
OpenAI 一口气发了三个 GPT-5.6 模型,编程更强的 Sol 比 Fable 便宜,还出了个能跨应用干活的 agent 和桌面应用,开发者快去体验。
OpenAI 给 GPT-5.6 分了三个档,Sol 专攻复杂编程和智能体任务,Terra 比上一代更强更便宜,Luna 跑得快还省一半钱。