全部动态
Anthropic 的 Opus 5 在 Agent Arena 上超过 GPT-5.6,你也能用自己提示词在 agent 模式里测试它。
Ideogram新出的物体移除工具,在RemovalBench上拿了第一,价格还最低,想清理图片里杂物可以试试。
想比较 Claude Opus 5 和 GPT 5.6 在真实智能体任务上的表现?这份报告用 7000+ 次任务告诉你谁更强、谁更划算。
Claude Opus 5 在 Agent Arena 和代码榜都冲进前三,Max 版更是双榜第一,比 GPT-5.6 还靠前,很强悍。
OpenAI 出了新语音转文字模型,错误率比 ElevenLabs 高不少,自己测试可以,正经用还是优先选 ElevenLabs 吧。
腾讯混元开源了AngelSpec,一个能帮你的模型推理提速近2倍的投机解码框架,实测比DFlash还快10%以上,代码和权重都直接可用了。
Wiz搞了个Atlas系统,让多个AI智能体像安全团队一样协作挖漏洞,已经在开源项目找到200多个漏洞,基准测试还超过了GPT-5.5-Cyber和Claude 4.6。
比亚迪悄悄拿出的HyWorldVLA,在NAVSIM上直接以90.59分拿下SOTA,这是他们首次秀自动驾驶基础模型肌肉。
OpenAI 这次发了两个转录模型,gpt-transcribe 在真实录音上词错误率只有 8.98%,比之前的 Whisper-1 好了一半,而且每分钟还便宜 25%,做语音转录的可以看看。
Anthropic 更新了 MCP 协议,去掉了会话绑定,现在 MCP 服务器能上云水平扩展了,serverless 也能跑,做工具链的可以试。
Liquid AI 新出的两个双向编码器,230M 在 CPU 上跑 8K 上下文只要 28 秒,350M 在 GLUE 等基准排第四,适合做嵌入和分类任务。
Twelve Labs 用三件套解决了传统视频处理漏掉动态和因果的问题,想做视频检索和推理的可以看看这套方案。
World Labs 这篇博客把模拟器定位成世界模型的核心,他们的 R2S2R 引擎能让机器人训练成本降很多,值得搞机器人开发的看看。
Ilya Sutskever的SSI可能找到了让AI像天才少年一样持续学习的方法,能力与安全在同一训练回路里,这个方向很不一样。
Pictura让自动驾驶策略直接从相机图像自对弈学,跑完3500万公里,性能逼近用真实位置速度的版本,值得AI研究员看看。
PRISM-AH在视频级矛盾识别上把macro F1从0.28翻到0.61,比直接看零样本强多了,适合研究多模态情感分析的人看看。
MODUS用一个解码器统一处理各种模态的输入输出,省去多个专用组件,性能不输专家模型,还开源了。
MCP 终于去掉会话 ID 了,部署起来像普通 HTTP 一样灵活。还有 MRTR 解决中途确认问题,很实用。如果你在生产环境用 MCP,得仔细看迁移指南。
月之暗面刚开源2.8万亿参数的Kimi K3,摩尔线程的国产GPU MTT S5000立马适配,能直接跑官方MXFP4格式,推理部署很方便。
新框架DynaBridge用多模态数据和语义摘要预测抑郁焦虑压力,在AdoDAS上F1达0.5,比基线强。
你想微调模型干专业活又怕它变傻?MemSFT加个记忆模块,领域知识涨了,通用能力不掉,比全参数微调靠谱。
OpenAI 出了两款转录模型,GPT-Live-Transcribe 实时转录延迟低,GPT-Transcribe 批量处理更便宜,错误率比 Whisper 低一半多。
Anthropic 和欧洲几所高校搞了个新基准,专门测大模型破解密码的本事,比单纯看推理能力更有针对性。
OpenAI 发的 GPT-Transcribe 在音频转录上比 Whisper 错误率低一半,多语言场景提升明显。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档