8月31日
09:06
09:06官方账号arXiv cs.LG@Rowzatul Zannat, Abdullah Al Shafi, K. M. Azharul Hasan, Atia Shahnaz Ipa
BanglaMed-QA是专为孟加拉语医疗领域设计的问答系统,包含4,493个问答对,覆盖506种疾病。该系统采用SVM模型进行问题分类,结合余弦、Jaccard等相似度度量方法。系统在自动化评估中达到95%的F1分数,人类满意度平均为0.9分。
推荐理由:孟加拉语医疗问答系统BanglaMed-QA上线,解决低资源语言医疗信息缺口,准确率达95%。
5月22日
10:42
10:42官方一手arXiv: DeepSeek@Md. Asaduzzaman Shuvo, Mahedi Hasan, Md. Tashin Parvez, Azizul Haque Noman, Md. Shafayet Hossain Ovi
精选
多语言大模型在处理孟加拉语等低资源语言时,常因文化语境缺失导致敬语使用错误。研究者构建了BLADE数据集,包含4196个精心设计的对话对,用于指令微调。通过LoRA适配器对DeepSeek-8B和LLaMA-3.2-3B进行参数高效微调,模型在结构保真度和敬语对齐上显著提升。该工作为低资源多语言生成中的语用鸿沟提供了基准。代码和数据集已开源。
推荐理由:做低资源语言NLP或文化敏感对话系统的团队,这个数据集直接解决了敬语对齐的痛点,可以拿来微调自己的模型试试。