全部动态
IBM 搞了个专门测 AI 代理迁移 Java 框架的基准,看看现有模型能不能搞定企业级代码迁移,结果发现连 GPT-4 都挺费劲。
Hugging Face分享了他们如何用GPT-4和GitHub Actions把库发布从两个月一次提速到每周一次,还保留了人工把关,挺实用的经验。
日本AI公司Sakana AI搞了个新系统叫Fugu,能让不同模型一起干活,不用只靠一家供应商。效果还跟Anthropic的Fable 5差不多,值得看看怎么做到的。
OpenAI 出了个新基准 LifeSciBench,专门测 AI 做生命科学研究的能力,比一般问答难多了,能看出模型哪里不行。
马斯克又出手了,SpaceX 花600亿买下 Cursor 团队,直接帮 xAI 对抗 OpenAI 和 Anthropic。
这款模型解决了实时语音交互中“等待录音结束”的痛点,做语音助手或实时翻译的开发者可以直接在 GitHub 上试玩,体验每 0.4 秒的决策能力。
企业团队终于可以在 AWS 生态内直接调用 OpenAI 前沿模型和 Codex,省去跨平台管理的麻烦。做 AI 应用部署的开发者建议试试,从评估到生产的速度会快很多。
GPT-5.5 Instant 的回复更自然,写作和编程任务直接在聊天中完成,省去了切换 Canvas 的麻烦。经常用 ChatGPT 写代码或文档的开发者,建议试试新版本,体验更流畅。
企业IT团队终于有了衡量AI智能体真实能力的标尺——前沿模型都不到50分,说明自动化运维还有很大提升空间,做IT运维或AI落地的建议点开看看差距在哪。
NVIDIA 的扩散语言模型将文本生成速度推向新高度,做实时对话或低延迟应用的开发者可以直接关注,它可能改变你对大模型推理速度的认知。
这项研究首次用实证数据证明 AI 能通过图灵测试,对关注 AI 社会影响和网络安全的人意义重大——做 AI 伦理或在线身份验证的团队值得仔细看,它会让你重新思考“像人”意味着什么。