DeepSeek新模型DeepSeek-V4-Flash-Vision-Exp发布,性能接近Opus-4.8,值得尝试。
全部动态
AI 相关资讯全量信息流 · 3051 条
8月21日
DeepSeek-V4-Flash-Vision-Exp发布,多模态模型性能提升
模型15:06
DeepSWE 超越 Fable 在 10 项任务中表现亮眼Ben Davis 在 x.com 上展示了 DeepSWE 在多项任务中的出色表现,比 Fable 和 GPT-5.6-sol 更胜一筹,值得关注。
模型05:35
Opus 5 与 GPT-5.6 Sol 在浏览器任务上表现接近Opus 5 和 GPT-5.6 Sol 在一个新浏览器基准上打平了,这个基准是真实用户任务,评估标准很细,看看谁更会上网吧。
Meta 发布 Muse Spark 1.2 (xHigh) 模型
Meta 刚刚发布了 Muse Spark 1.2 (xHigh),在 Agent Arena 上的净提升分数从 0.9% 提升到了 2.1%,Bash Recovery 任务直接翻倍,比前代强了不少。
GEN-1.5 的成功秘诀:重复动作与 UMI 数据收集
GEN-1.5 的成功秘诀在于利用人类数据中的自然重复动作。这些重复主要来自对称模式,如 IKEA 组装手册中的螺栓配对,以及人类的恢复动作。关键在于保留失败的尝试,而非过度清理数据。另一个关键因素是 UMI(直接人类数据收集),它比传统的遥操作(teleop)更能保留人类的物理直觉。有了足够数据,许多行为可以实现零样本学习,无需微调。
8月20日
Claude Code网页实验中Fable 5自动部署GitHub Actions流程
Claude Code实验里Fable 5主动搞了个GitHub Actions流程,自己把实验跑起来,比之前手动弄方便多了。
模型13:41
Qwen3.8 - Max 在 Kilo 前端代码榜单位列第四你可以试试 Qwen3.8 - Max 在 Kilo 上,它在 Frontend Code 榜单排第4,比 Claude Fable 5 高一点,做前端代码相关还行。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档