20:02官方账号arXiv cs.AI@Yen-Ju Lu, Yuzhe Wang, Yaohan Guan, Xiluo He, Jiarui Hai, Mingrui Liang, Kaavya Chaparala, Thomas Thebaud, Laureano Moro-Velazquez, Najim Dehak, Jesus Villalba精选73°研究人员提出ContraTalk基准测试,包含501个问题,涵盖交互行为、情感状态等五个话语维度。实验显示,纯文本LLM在一致案例中准确率超90%,但在冲突案例中降至33-48%。Audio Twin框架通过将语音转换为文本可读表示,改善了冲突案例的准确率并减少了陷阱选择。论文ContraTalkAudio Twin多模态推荐理由:ContraTalk揭示了语音理解中的文本偏差问题,Audio Twin框架为多模态推理提供了新思路。原文稍后读已读值得跟进有用关注 ContraTalk
09:39官方账号arXiv cs.AI@Sicheng Yang, Shulan Ruan, Shiwei Wu, Yu Liu, Lu Fan, Zhi Li, You He72°PolySpeech-100 是一个大规模语音理解基准,覆盖 110 种语言变体,包括 19 种中文方言和 80 多种低资源语言。它采用混合构建流程,结合人工录音和指令驱动合成语音,解决了现有基准偏重高资源语言、仅关注 ASR 而非语义推理、忽视方言的问题。评估 22 个模型(如 Gemini-3、GPT-Audio、Qwen2.5-Omni)后发现:开源端到端模型在重方言上优于级联系统,但低资源语言上性能严重下降;链式思维提示在零样本设置下反而降低大多数模型的语音理解能力。该基准为下一代包容性语音大模型建立了严格标准,数据和代码已开源。论文语音理解基准测试多语言/方言推荐理由:语音理解基准终于覆盖了方言和低资源语言,做多语言语音模型或方言应用的团队可以直接用这个基准来评估自己的模型,避免只测英语的偏科问题。原文稍后读已读值得跟进有用关注 语音理解