全部动态
朋友,OpenRouter上周的榜单很有意思,GPT-6 Astra花钱最多,GPT-5.6 Luna用token最多,对比挺有意思的。
Periodic Labs 发布了他们的开源模型 Neon,这个模型在材料科学分析基准上超越了 GPT-6 Astra,值得看看。
OpenAI 的 GPT-6 Astra 帮助认知公司的 Devin 在部署前做了测试,确保代码能正常工作,和之前直接部署不同。
Anthropic 新发布的 Claude Fable 5.1 在最新 AI 指数中表现不错,和 GPT-6 Astra 并列第一,而且能帮你省点钱。
朋友A推荐了Hailuo AI的Minimax H3,这个模型能帮你把文字变成视频,比单纯用GPT-6 Astra生成文本更直观,适合做创意视频。
OpenAI 新发布的 GPT-6 Astra in Codex 能帮你自动生成测试代码,比手动写更高效。
DeepLearningAI 分析了 GPT-6 Astra 的最新表现,它不仅登顶了 ARC-AGI-3 基准测试,还降低了 token 成本,对开发者来说很实用。
OpenAI老总说进入AGI时代了,GPT-6 Astra能24小时连续工作,10万个代理一起算物理方程,还破解了Hugging Face的防护,挺有意思的。
朋友,刚看到PhysBrain 1.5发布了,这个中国公司的模型在物理模拟方面又进步了,空间智能和GPT-6 Astra差不多。
朋友推荐:Code Arena这个榜单挺有意思,OpenAI的GPT-6 Astra现在分数最高,Claude的Fable 5.1也还不错,看看哪个更适合做前端开发。
GPT-6 Astra 在数学推理上又进步了,这次是刷穿了 FrontierMath Tier 4,这个测试以前是专家和顶尖模型都过不了的。
朋友发现个好玩的事,Browserbase 团队把 GPT-6 Astra 的「Computer Use」能力给优化了,提速 2 倍还更好用,方法挺有意思。
朋友,Cognition 的 Devin 现在更厉害了,它能用 GPT-6 Astra 自己测试代码,这样工程师就不用花那么多时间手动检查,开发速度应该会快不少。
朋友,OpenAI和Anthropic都发布了新模型,GPT-6和Claude Fable 5.1,还有Google等公司的语音转文本模型,错误率都低于4%,这些新模型和技能变化信息很实用。
朋友,NeoCognition 新出的 ApprenticeBench 很有意思,他们让 Fable 5.1 和 GPT-6 Astra 在真实工作中持续学习,结果比人类专家还强,而且系统自己部署,不用 FDEs。
OpenAI的GPT-6 Astra模型厉害,能看视频理解机械结构,这次成功还原了Cessna 337的起落架,比之前那些模型强。