全部动态
OpenAI降低了GPT-5.6 Sol的API和信用定价,使其在价格和性能上更具竞争力,值得关注。
Inherent新推Faraday智能体,小模型大能力,强化学习助其超越GPT-5.5与Claude Opus 4.8,值得关注。
开源开发者有了新基准,Qwen3.8-27B横扫消费级硬件,比肩GPT-5.6 Luna和DeepSeek V4 Flash,参数量27亿,4位量化后适配24GB GPU,超越它才是新标准!
Ben Davis 在 x.com 上展示了 DeepSWE 在多项任务中的出色表现,比 Fable 和 GPT-5.6-sol 更胜一筹,值得关注。
阿里刚发了 Qwen-UI-Agent,能直接操作手机电脑屏幕,移动端比 GPT-5.6 Sol 高 12 个点,还能在真实手机上跑任务,以后帮你自动查地址、订高铁、整理文件应该更靠谱了。
Artificial Analysis刚发了搜索API基准,用GPT-5.6 Luna测了7家提供商,帮你选搜索工具时看质量、成本、速度。
OpenAI官方晒了组省钱实测:Hypha AI用GPT-5.6 Luna把文档提取成本降到1/18,准确率还保住98%;RogoAI靠工具调用省了21%输入token。
OpenAI 的 GPT-5.6 Sol 在 ARC-AGI-3 上分数翻倍还多,token 还省了六倍,看看他们怎么做到的。
Moonshot AI 出了个新测试 PerceptionBench,专门查 AI 的“眼神”。结果最强模型 GPT-5.6 Sol 准确率也不到 60%,而且很多错是从看图时就错了。
一个叫Faraday的27B智能体,把论文复现变成强化学习任务,在测试集上赢了Claude Opus 4.8和GPT-5.5,还把编码agent当工具用,有点意思。