全部动态

AI 相关资讯全量信息流 · 54 条
9月23日
9月22日
9月17日
AITOP16:09
Anthropic拟10月在新加坡设亚太第五个办事处 开...

Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…

9月16日
9月14日
9月9日
9月4日
9月1日
8月25日
8月18日
8月17日
8月13日
8月12日
8月7日
AITOP17:04
出口结构剧变:中国卖给世界的,不再是产品而是解法

中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…

8月2日
8月1日
7月31日
7月30日
7月24日
7月23日
7月21日
7月17日
论文精选17:48
AI协助解决统计学开放问题:GPT-5.6证明BH过程无法控制FDR

AI真的在推动数学进步了:GPT-5.6只用90分钟就找到了统计学里一个经典开放问题的反例,而5.5版本折腾20小时都没搞定。这篇报告值得所有关心AI科研能力的人看。

事件专题
Marc Andreessen@pmarca2 个信源在谈原文
7月16日
7月14日
7月6日
7月1日
6月30日
6月29日
6月17日
6月16日
论文多源确认10:05
Agentic AI生成并行Julia代码的可扩展性研究

这篇论文测试了GPT-5.5、Claude Opus 4.7和Qwen3-Coder-Next用智能体写并行Julia代码,在超算上跑192核,发现小规模还行,大规模容易死锁或OOM,开源模型最差。做HPC或Julia并行开发的人值得看。

事件专题
arXiv: Anthropic@Linus Bantel 等 4 人11 个信源在谈原文
6月12日
论文多源确认10:15
EpiBench:AI智能体在表观基因组学分析中的可验证基准

做基因组学分析的团队终于有了一个可复现的AI能力评估标准——EpiBench揭示了当前最强模型在专业科学判断上的天花板,做生物信息学工具开发或AI+生命科学研究的建议点开看看差距在哪。

事件专题
arXiv cs.AI@Harihara Muralidharan 等 5 人11 个信源在谈原文
6月11日
6月10日
6月9日
论文多源确认精选72°09:40
Scaffold 选择影响 GAIA 准确率高达 28 个百分点:模型能力评估需谨慎

做 AI 模型评测或选型的人必须看——这篇研究用严格对照实验证明,你看到的模型能力分数可能更多反映的是 scaffold 设计而非模型本身,建议重新审视自己的评估流程。

事件专题
arXiv: Anthropic@Jason Starace11 个信源在谈原文
6月4日
论文精选12:09
Discourse-Role Labels 影响语言模型对上下文的采纳程度

这篇论文揭示了标签选择能显著改变模型对误导信息的采纳率(最高差 84 个百分点),做 RAG 系统或上下文增强应用的开发者需要警惕:你用的标签可能无意中放大了错误信息的影响。建议点开了解如何控制这一变量。

arXiv: DeepSeek@Jianguo Zhu原文
6月2日
论文12:05
K-BrowseComp:首个韩语网页浏览智能体基准测试

做多语言智能体或网页浏览任务的团队会立刻意识到差距——韩语场景下最强模型准确率不到一半,说明现有评估严重偏向英语。做韩语 NLP 或本地化产品的开发者可以直接用这个基准测试自己的模型。

事件专题
arXiv: DeepSeek@Nahyun Lee 等 15 人2 个信源在谈原文