8月28日
21:28
21:28Stanford AI Lab@StanfordAILab
Terminal-Bench-Science是一个评估AI代理在科研工作流表现的基准测试。该基准由斯坦福大学领导,v0.1版本包含70个任务。Claude Opus 5仅能解决约30%的任务。这是Terminal-Bench团队与全球科研机构科学领域专家共同开发的成果。
推荐理由:斯坦福发布了科研AI代理基准Terminal-Bench-Science,Claude Opus 5仅完成30%,看看你的模型表现如何。
8月27日
10:18
10:18官方账号arXiv cs.LG@Ye Shen, Yuting Zheng, Dun Pei, Zijian Chen, Wenlong Zhang, Qi Jia, Guangtao Zhai
SciMIF是一个新的基准,旨在评估多模态大型语言模型在遵循复杂科学指令方面的能力。通过分析5个代表性科学学科的22个不同任务,提出包含10个约束组的全面分类法。实验发现,不同科学学科间存在显著性能差异,化学对当前MLLMs更具挑战性。SciMIF填补了评估科学领域多模态指令遵循的空白,为MLLMs在严格科学应用中的未来改进奠定基础。数据与代码将在GitHub上发布。
推荐理由:SciMIF基准为评估MLLMs在科学领域的指令遵循能力提供了新工具,揭示了不同学科间的性能差异,对科学研究和MLLMs发展具有重要意义。