全部动态

AI 相关资讯全量信息流 · 1222 条
5月31日
5月30日
5月29日
产品多源确认精选72°21:32
ChatGPT 推出新版 GPT-5.5 Instant,改进谄媚、事实性和多语言表现

如果你在用 ChatGPT 做事实核查或多语言任务,新版 5.5 Instant 值得一试——它直接解决了旧版过于固执和谄媚的问题,对需要准确答案的开发者来说是个实用升级。

事件专题
官方账号Greg Brockman@gdb11 个信源在谈原文
5月28日
论文精选11:36
SpatialBench-Long:评估AI在空间生物学中的长程推理能力

空间生物学研究者终于有了衡量AI科学推理能力的硬核基准——SpatialBench-Long 要求智能体从复杂空间数据中推导真实结论,而非简单跑流程。做生物信息学或AI for Science的团队,值得看看当前模型的表现差距在哪里。

arXiv: OpenAI@Ian Diks 等 4 人原文
行业Agent 与开发者多源确认10:10
Anthropic 和 OpenAI 找到产品-市场契合点,企业 API 定价飙升

企业团队和重度 AI 用户需要了解 API 定价变化——你的账单可能正在飙升,而订阅计划仍是个人用户的最佳选择。建议检查你的企业合同,避免意外超支。

事件专题
官方账号Simon Willison’s Weblog11 个信源在谈原文
5月27日
模型中美对照多源确认88°20:56
AI 跨过推理奇点:Anthropic 与 OpenAI 前沿模型能力跃迁

AI 推理能力从片段到完整体系的跃迁,是开发者和安全从业者必须关注的分水岭——Claude Mythos 的防御性开放和 OpenAI 的数学突破,直接改变了模型应用边界,建议点开了解具体案例。

事件专题
berryxia@berryxia11 个信源在谈原文
模型中美对照多源确认76°19:06
继 OpenAI 后,Anthropic 的 Claude Mythos 也解出 80 年数学难题

AI 连续攻克经典数学难题,证明大模型在数学推理上正在突破边界。对数学研究者和 AI 能力观察者来说,这是值得关注的里程碑——Claude 的解法虽稍逊,但思路独特,建议点开对比两家思路。

事件专题
IT之家11 个信源在谈原文
MeDial-Speech:111小时医患对话数据集发布,Claude Sonnet 4 表现最佳

医疗 AI 终于有了真实场景的语音对话基准——111 小时医患对话数据,覆盖四种疾病,做医疗对话系统的团队可以直接拿来训练和测试模型。Claude Sonnet 4 在句子选择上领先,但所有模型都过度自信,这个发现值得关注。

arXiv: DeepSeek@Heriberto Cuayahuitl, Grace Jang原文
5月26日