09:25官方账号arXiv cs.LG@Jieying Xue, Phuong Minh Nguyen, Minh Le Nguyen, Shogo Okada精选73°该研究探索了功能向量(FVs)在多语言多标签情感识别任务中的跨语言迁移能力。研究显示,从源语言提取的功能向量能在零样本设置中显著提升目标语言性能,无需推理时提供演示。每个大语言模型在构建有效功能向量时表现出相对稳定的最佳注意力头范围,且这一模式在不同语言中保持一致。论文功能向量情感识别跨语言推荐理由:论文发现功能向量能跨语言传递任务信号,无需演示即可提升多语言情感识别性能,比少样本学习更高效。原文稍后读已读值得跟进有用关注 功能向量
18:06官方账号arXiv cs.LG@Zihan Ding, Liyu Zhang, Xiaomin Ouyang精选73°HALO模型通过两阶段训练框架解决IMU传感异构性问题。该模型在10个公共HAR数据集上预训练,在7个保留数据集上评估。HALO仅使用约3500万参数,比MOMENT模型少10倍,但在87个训练标签的零样本开放集准确率上提高13.7个百分点。在两个分布严重偏移的数据集上,所有模型包括HALO的零样本性能均崩溃。论文HALOIMU人体活动识别推荐理由:HALO模型用更少参数实现更高准确率,解决IMU传感异构性问题,适合开放集人体活动识别。原文稍后读已读值得跟进有用关注 HALO
17:29官方账号arXiv cs.AI@Kechen Liu, Ola Shorinwa精选73°CLAP框架通过整合人类和机器人视频数据,实现了跨实体动作条件视频生成。该模型在DROID等挑战性环境中达到或超越现有单实体视频模型性能。CLAP支持末端执行器姿态、语言指令和潜在动作等多种动作条件空间,适用于多种机器人形态。研究团队已开源所有代码和模型。AI模型CLAP视频生成物理模拟推荐理由:CLAP让不同机器人共享物理知识,无需重新训练就能在新任务上零样本部署,比单模型更通用。原文稍后读已读值得跟进有用关注 CLAP
00:58Jim Fan@DrJimFan82°GEN-1.5 的成功秘诀在于利用人类数据中的自然重复动作。这些重复主要来自对称模式,如 IKEA 组装手册中的螺栓配对,以及人类的恢复动作。关键在于保留失败的尝试,而非过度清理数据。另一个关键因素是 UMI(直接人类数据收集),它比传统的遥操作(teleop)更能保留人类的物理直觉。有了足够数据,许多行为可以实现零样本学习,无需微调。AI模型GEN-1.5UMI机器人推荐理由:GEN-1.5 的成功秘诀在于利用人类数据中的自然重复动作。这些重复主要来自对称模式,如 IKEA 组装手册中的螺栓配对,以及人类的恢复动作。关键在于保留失败的尝试,而非过度清理数据。另一个关键因素是 UMI(直接人类数据收集),它比传统的遥操作(teleop)更能保留人类的物理直觉。有了足够数据,许多行为可以实现零样本学习,无需微调。原文稍后读已读值得跟进有用关注 GEN-1.5
10:05官方账号arXiv cs.LG@Rui Liu, Benjamin Paassen表面肌电(sEMG)用于控制假肢,但现有研究多聚焦基本动作,而日常活动需组合动作。论文提出CPI和SAP两种原型网络方法,实现仅用基本动作训练后零样本识别未见组合动作。在NearLab、NinaPro DB3及新采集的BasCom数据集上,SAP准确率较现有零样本方法提升超过20%。用户在线实验也验证了优势。论文sEMGCPI零样本学习推荐理由:这篇论文提出了两种新方法,只用基本动作训练就能识别组合动作,在多个数据集上准确率提升超20%,挺实用。原文稍后读已读值得跟进有用关注 sEMG
09:42官方一手arXiv: Google DeepMind@Ismail Ismail Tijjani, Ahmad Abubakar Mustapaha, Sunusi Ibrahim Muhammad, Muhammad Bashir Aliyu本研究评估了五种视觉语言模型(Gemini 2.0 Flash Exp、Qwen2.5-VL-7B-Instruct、GPT-4o、Claude 4 Sonnet、Llama 3.2 Vision 90b)在尼日利亚车牌识别中的零样本学习表现。使用包含88张真实环境图像的测试集,基于字符错误率(CER)指标,Gemini与Qwen在准确性和鲁棒性上显著优于其他模型。该工作对比了VLM与传统YOLO+OCR管线的优劣,并质疑了模型提供商的性能宣称。论文Gemini 2.0 Flash ExpQwen2.5-VL-7B-Instruct零样本学习推荐理由:用真实非洲场景测了5个主流VLM,发现Gemini和Qwen在车牌识别上比YOLO+OCR更准,有数据有对比。原文稍后读已读值得跟进有用关注 Gemini 2.0 Flash Exp
11:22官方账号arXiv cs.LG@Haitao Wu, Qirui Zhang, Zhouheng Yao, Shangquan Sun, Qihao Zheng, Mianxin Liu, Chi Zhang, Wanli Ouyang, Chunfeng Song, Changqing Zhang, Jiamin WuBrainJanus是首个将脑、视觉和语言整合到单一框架的统一脑模型。它引入Unified Brain Tokenizer将连续神经活动量化为离散Token,并与视觉和语言表征对齐到共享的Omni空间。基于All-in-One自回归架构,该模型通过下一个Token预测实现图像到脑、文本到脑的编码以及脑到图像、脑到文本的解码。在多项基准测试中,BrainJanus取得优越性能,并展现出零样本泛化能力和可解释的生物拓扑结构。代码已在GitHub开源。论文BrainJanus脑机接口多模态推荐理由:这篇论文提出了BrainJanus,一个能双向翻译脑信号与图像、文本的统一模型,在零样本和生物可解释性上突破传统方法。原文稍后读已读值得跟进有用关注 BrainJanus
10:01官方账号arXiv cs.AI@Tarandeep Singh, Soumyanetra Pal, Soham Biswas, Nishanth Chandran精选本文提出一种三阶段流水线,用于从监控视频中零样本理解事故,包括何时发生冲击、何种类型以及发生在画面何处。第一阶段通过视觉-语言相似性提取冲击附近的时间窗口;第二阶段利用元数据驱动多提示推理,结合五个互补视角(基线、运动、几何、对比和决胜)并通过熵门控成对裁决器解决分歧;第三阶段基于预测的事故类型和场景布局,使用开放词汇检测器定位冲击,并通过得分加权质心聚合关键帧检测结果。该方法在零样本ACCIDENT @ CVPR基准上显著优于中心帧基线,表明将零样本视频理解分解为时间定位、语义分类和空间定位能比直接提示更可靠地利用视觉-语言模型。论文零样本学习视频理解多提示推理推荐理由:这篇论文解决了监控视频中事故理解的零样本难题,做视频分析或安全监控的开发者可以直接借鉴其三阶段分解思路,比传统提示方法更可靠,值得一试。原文稍后读已读值得跟进有用关注 零样本学习