8月26日
10:27
10:27官方账号arXiv cs.LG@Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier Stricker
MoTE(混合任务专家)是一种解码器架构,将大型语言模型的正向网络转换为特定任务的专家,同时保持多模态骨干共享。在五个COIN基准上评估,该模型在VideoLLM-MoTE上实现了比最近的VideoLLM基线更高的平均top-1准确率。
推荐理由:MoTE模型在多任务视频语言学习方面提供了可解释且计算高效的解码器替代方案,值得一看。
7月29日
11:17
11:17官方账号arXiv cs.AI@Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan, Jesse Allardice, David Mizrahi, Oğuzhan Fatih Kar, Roman Bachmann, Amir Zamir
76°
MODUS是一个仅解码器的any-to-any多模态模型,无需模态特定的输出头或损失函数,就能从任意组合的输入模态预测任意输出模态。它在视频、图像、语言等模态上直接使用预训练解码器,无需重头训练。在多个基准测试中,MODUS与专业模型和多任务基线性能相当甚至更优。所有代码和模型权重已在 modus-multimodal.epfl.ch 开源。
推荐理由:MODUS用一个解码器统一处理各种模态的输入输出,省去多个专用组件,性能不输专家模型,还开源了。