全部动态

AI 相关资讯全量信息流 · 373 条
5月28日
论文精选11:36
SpatialBench-Long:评估AI在空间生物学中的长程推理能力

空间生物学研究者终于有了衡量AI科学推理能力的硬核基准——SpatialBench-Long 要求智能体从复杂空间数据中推导真实结论,而非简单跑流程。做生物信息学或AI for Science的团队,值得看看当前模型的表现差距在哪里。

arXiv: OpenAI@Ian Diks 等 4 人原文
行业Agent 与开发者多源确认10:10
Anthropic 和 OpenAI 找到产品-市场契合点,企业 API 定价飙升

企业团队和重度 AI 用户需要了解 API 定价变化——你的账单可能正在飙升,而订阅计划仍是个人用户的最佳选择。建议检查你的企业合同,避免意外超支。

事件专题
官方账号Simon Willison’s Weblog11 个信源在谈原文
5月27日
模型中美对照多源确认88°20:56
AI 跨过推理奇点:Anthropic 与 OpenAI 前沿模型能力跃迁

AI 推理能力从片段到完整体系的跃迁,是开发者和安全从业者必须关注的分水岭——Claude Mythos 的防御性开放和 OpenAI 的数学突破,直接改变了模型应用边界,建议点开了解具体案例。

事件专题
berryxia@berryxia11 个信源在谈原文
模型中美对照多源确认76°19:06
继 OpenAI 后,Anthropic 的 Claude Mythos 也解出 80 年数学难题

AI 连续攻克经典数学难题,证明大模型在数学推理上正在突破边界。对数学研究者和 AI 能力观察者来说,这是值得关注的里程碑——Claude 的解法虽稍逊,但思路独特,建议点开对比两家思路。

事件专题
IT之家11 个信源在谈原文
5月26日
5月25日
5月24日
5月23日
模型中美对照多源确认16:21
Deepseek V4 Pro vs GPT-5.5 游戏开发对决:便宜4.3倍但质量落后

想用 AI 做游戏开发的团队,这个对比直接告诉你:省钱不一定省心——Deepseek 便宜但质量差一截,GPT-5.5 贵但成品更靠谱,建议根据预算和品质要求选模型。

事件专题
@atomic_chat_hq@atomic_chat_hq4 个信源在谈原文
5月22日
产品Agent 与开发者多源确认83°07:26
Cursor Composer 2.5 发布:低成本高性能编程代理,成本仅为竞品1/60

Cursor 用 1/60 的成本实现了接近顶级模型的编程代理性能,做自动化开发或频繁使用 AI 编程的团队可以直接省下大笔费用,建议试试 Fast 模式感受响应速度。

事件专题
eric zakariasson@ericzakariasson11 个信源在谈原文
5月21日
5月20日
5月19日
论文中美对照多源确认精选10:26
Mythos漏洞复现基准测试:GPT-5.5仅5/18成功

这个实验戳破了AI漏洞发现能力的泡沫——即使给定了目标文件,顶级模型复现已知漏洞的成功率也极低。做AI安全评估或漏洞研究的团队,看完会重新审视benchmark的可靠性。

事件专题
arXiv: Anthropic@Isaac David, Arthur Gervais11 个信源在谈原文
5月18日
5月16日