全部动态

AI 相关资讯全量信息流 · 38 条
9月22日
9月17日
AITOP16:09
Anthropic拟10月在新加坡设亚太第五个办事处 开...

Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…

9月16日
9月14日
9月9日
8月25日
8月18日
8月17日
8月13日
8月12日
8月7日
AITOP17:04
出口结构剧变:中国卖给世界的,不再是产品而是解法

中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…

8月2日
7月31日
7月30日
7月24日
7月23日
7月21日
7月17日
7月14日
7月1日
6月30日
6月17日
6月16日
论文多源确认10:05
Agentic AI生成并行Julia代码的可扩展性研究

这篇论文测试了GPT-5.5、Claude Opus 4.7和Qwen3-Coder-Next用智能体写并行Julia代码,在超算上跑192核,发现小规模还行,大规模容易死锁或OOM,开源模型最差。做HPC或Julia并行开发的人值得看。

事件专题
arXiv: Anthropic@Linus Bantel 等 4 人11 个信源在谈原文
6月12日
论文多源确认10:15
EpiBench:AI智能体在表观基因组学分析中的可验证基准

做基因组学分析的团队终于有了一个可复现的AI能力评估标准——EpiBench揭示了当前最强模型在专业科学判断上的天花板,做生物信息学工具开发或AI+生命科学研究的建议点开看看差距在哪。

事件专题
arXiv cs.AI@Harihara Muralidharan 等 5 人11 个信源在谈原文
6月11日
6月10日
6月9日
论文多源确认精选72°09:40
Scaffold 选择影响 GAIA 准确率高达 28 个百分点:模型能力评估需谨慎

做 AI 模型评测或选型的人必须看——这篇研究用严格对照实验证明,你看到的模型能力分数可能更多反映的是 scaffold 设计而非模型本身,建议重新审视自己的评估流程。

事件专题
arXiv: Anthropic@Jason Starace11 个信源在谈原文
6月4日
论文精选12:09
Discourse-Role Labels 影响语言模型对上下文的采纳程度

这篇论文揭示了标签选择能显著改变模型对误导信息的采纳率(最高差 84 个百分点),做 RAG 系统或上下文增强应用的开发者需要警惕:你用的标签可能无意中放大了错误信息的影响。建议点开了解如何控制这一变量。

arXiv: DeepSeek@Jianguo Zhu原文
6月2日
论文12:05
K-BrowseComp:首个韩语网页浏览智能体基准测试

做多语言智能体或网页浏览任务的团队会立刻意识到差距——韩语场景下最强模型准确率不到一半,说明现有评估严重偏向英语。做韩语 NLP 或本地化产品的开发者可以直接用这个基准测试自己的模型。

事件专题
arXiv: DeepSeek@Nahyun Lee 等 15 人2 个信源在谈原文
6月1日
5月28日
论文精选11:36
SpatialBench-Long:评估AI在空间生物学中的长程推理能力

空间生物学研究者终于有了衡量AI科学推理能力的硬核基准——SpatialBench-Long 要求智能体从复杂空间数据中推导真实结论,而非简单跑流程。做生物信息学或AI for Science的团队,值得看看当前模型的表现差距在哪里。

arXiv: OpenAI@Ian Diks 等 4 人原文
5月26日
5月25日
5月21日
5月19日
论文中美对照多源确认精选10:26
Mythos漏洞复现基准测试:GPT-5.5仅5/18成功

这个实验戳破了AI漏洞发现能力的泡沫——即使给定了目标文件,顶级模型复现已知漏洞的成功率也极低。做AI安全评估或漏洞研究的团队,看完会重新审视benchmark的可靠性。

事件专题
arXiv: Anthropic@Isaac David, Arthur Gervais11 个信源在谈原文
5月15日
论文精选10:11
Autoresearch 框架 Automat 自动设计材料科学描述符,超越 Magpie 基线

材料科学家和 AI for Science 研究者终于有了一个能自动设计描述符的框架——Automat 用 GPT 智能体替代了繁琐的手动特征工程,在带隙和居里温度预测上直接超越经典 Magpie 基线,做材料信息学的团队值得一试。

arXiv: OpenAI@Matteo Cobelli, Stefano Sanvito原文
5月13日
论文精选70°19:12
三机制框架:LLM 如何处理训练知识与上下文冲突

这个框架解决了 LLM 行为研究中一个长期矛盾的谜题——为什么有的实验说模型死记硬背,有的说模型灵活跟随。做 LLM 评测或 prompt 工程的人,看完能更精准地预测模型在知识冲突场景下的行为,建议直接读原文的机制划分部分。

arXiv: DeepSeek@Pruthvinath Jeripity Venkata原文
5月12日