#多模态

7月16日
7月15日
7月14日
论文12:26
E-VQA:证据支持的视频问答任务与ST-Evidence基准发布

Salesforce AI Research 发布了 E-VQA 任务和 ST-Evidence 基准,解决了视频问答无法验证视觉证据的问题。如果你想理解视频模型真正“看到”了什么,这篇论文值得一读。

官方账号arXiv cs.AI@Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles原文
7月13日
论文10:51
视觉预训练:一种可扩展的语言智能预训练方法

这篇论文发现,把文档当图片直接预训练,比先转成纯文本再训练效果更好,感兴趣的可以看看实验细节。

事件专题
官方账号arXiv cs.AI@Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen2 个信源在谈原文
论文09:56
SAGEAgent:用于多模态生存预测中成本感知模态获取的自我进化智能体

这篇论文提出了SAGEAgent,它能像医生一样判断该给病人做哪些检查,在几乎不掉准确率的前提下把检查负担砍掉一半多,挺实用的。

官方账号arXiv cs.AI@Chongyu Qu, Can Cui, Zhengyi Lu, Junchao Zhu, Tianyuan Yao, Junlin Guo, Juming Xiong, Yanfan Zhu, Yuechen Yang, Bennett A. Landman, Yuankai Huo原文
7月12日
7月11日
7月10日