全部动态
想看看 AI 在真实电脑操作上能走多远?OSWorld2.0 拿 100 个长任务测智能体,GPT-4o 都只拿到 15% 成功率,差距一目了然。
OpenAI 的 GPT-5.6 Sol Preview 悄悄在 Cursor 里测试,上下文直接拉到 1M,能一口气吞整本小说了。
Epoch AI 搞了个新基准 MirrorCode,让 AI 连续写几天代码,最强模型能干人类几周的活,想看看 AI 编程天花板在哪可以关注。
想看看你用的LLM在多工具长流程场景下到底多靠谱?PlanBench-XL用上千个工具设计了真实任务链,测出来主流模型成功率不到40%,值得一测。
OpenAI 联手 Trail of Bits 和 HackerOne,用 Codex Security 帮开源项目快速修漏洞,人工把关,靠谱。
Anthropic 新旗舰模型 Mythos 今晚发布,做 AI 应用开发或模型对比的团队可以第一时间关注,看看它能否在推理和代码任务上超越 GPT-4。
Browser Use 用 Rust 重写后,解决了旧版预定义动作空间导致模型失败不知原因的痛点,做浏览器自动化或 AI 代理的开发者可以直接升级体验更可靠的执行。
AI 推理成本断崖式下跌正在重塑行业格局,做 AI 应用或基础设施的团队值得关注——路由策略能直接省下 80% 成本,建议尽早布局。
做视觉创意或快速原型的设计师、内容创作者,可以试试用 Codex 的白板功能直接抓取网页图像并混搭,比手动截图拖拽快得多。
本地 Agent 开发者终于不用等大模型了——1.5B 活跃参数就能跑出接近 4 倍参数模型的效果,笔记本就能部署,隐私和延迟都解决了,做本地自动化的建议直接试。
做 AI 产品战略或关注模型竞争的读者,这篇专访点出了技术领先不等于市场领先的残酷现实——Google 的组织惯性如何让先发优势变成后发劣势,值得所有技术团队反思。
AI 环境影响是开发者绕不开的话题,Simon Willison 戳破了 GPT-4 水耗估算的泡沫,做 AI 可持续性研究的团队值得关注。
这篇论文戳穿了AI暂停条约的技术漏洞——分布式训练让监管形同虚设,做AI治理、安全研究的团队值得细看,看完会对现有方案的有效性重新评估。
想理解AI芯片供应链的命脉在哪?ASML的EUV光刻机是NVIDIA H100和GPT-4等一切先进芯片的起点,做AI硬件或关注产业链的读者值得一看。
AI 从设计到代码全包了,做科学可视化或教育应用的开发者可以直接抄作业,省掉 UI 和纹理设计的时间。
Mollick的观点呼应了业界对AI生成内容同质化的担忧:模型本身能产出不错的文本,但大规模使用导致读者审美疲劳。这提醒开发者和内容创作者在利用AI写作时需注意差异化与质量把控。