全部动态

AI 相关资讯全量信息流 · 1224 条
6月17日
6月16日
论文多源确认10:05
Agentic AI生成并行Julia代码的可扩展性研究

这篇论文测试了GPT-5.5、Claude Opus 4.7和Qwen3-Coder-Next用智能体写并行Julia代码,在超算上跑192核,发现小规模还行,大规模容易死锁或OOM,开源模型最差。做HPC或Julia并行开发的人值得看。

事件专题
arXiv: Anthropic@Linus Bantel 等 4 人11 个信源在谈原文
6月15日
6月14日
6月13日
6月12日
产品Agent 与开发者多源确认73°15:09
Artificial Analysis 更新编程智能体排行:DeepSWE 取代 SWE-Bench Pro,Claude Fable 5 登顶

基准测试更新直接影响了主流编程智能体的排名,做 AI 编程工具选型或评估模型能力的开发者值得关注——Claude Fable 5 新登顶,Codex 也大幅提升,建议点开看具体得分和对比。

事件专题
官方账号Artificial Analysis@ArtificialAnlys11 个信源在谈原文
论文多源确认10:15
EpiBench:AI智能体在表观基因组学分析中的可验证基准

做基因组学分析的团队终于有了一个可复现的AI能力评估标准——EpiBench揭示了当前最强模型在专业科学判断上的天花板,做生物信息学工具开发或AI+生命科学研究的建议点开看看差距在哪。

事件专题
arXiv cs.AI@Harihara Muralidharan 等 5 人11 个信源在谈原文