09:32官方一手arXiv: DeepSeek@Mohammad Hossein Shalchian, Mostafa Amiri, Amir Mahdi Sadeghzadeh研究人员使用DeepSeek-V3-0324、GPT-OSS-120B和Qwen3-235B-A22B-Instruct-2507三种LLM为波斯语聊天数据生成标注,训练了四个MatinaRoberta-based NER模型。OSS_ZeroShot标注产生的模型在宏平均F1和标签覆盖率召回率(LCR)上表现最佳,能在单块RTX 3090上约2分钟内完成4万条消息的匿名化处理。论文PersianAnonymizerNERDeepSeek-V3-0324推荐理由:波斯语数据匿名化新方案,用LLM标注训练轻量NER模型,消费级GPU上2分钟处理4万消息。原文稍后读已读值得跟进有用关注 PersianAnonymizer
11:49官方账号arXiv cs.AI@Pouria Mahdi, Haq Nawaz Malik波斯语虽然被超过1.1亿人使用,但其OCR技术远落后于拉丁语系语言,原因是文字复杂且缺乏大规模标注数据。Persian Pixel数据集包含343,000多张高保真图像-文本对,来自精心筛选的700万波斯词语料库。生成管道SynthOCR-Gen模拟了波斯文字连写、字形变体、变音符号等特征,并加入25种以上随机退化模型(如墨迹扩散、纸张老化、模糊等)。该数据集可用于训练TrOCR、Donut等基于Transformer的OCR模型,为低资源复杂文字OCR提供可扩展的合成数据方案。论文Persian PixelOCR波斯语推荐理由:做波斯语OCR不用愁数据了,Persian Pixel有34万张合成图加上25种真实退化模拟,直接拿它训模型比手动标注省事得多。原文稍后读已读值得跟进有用关注 Persian Pixel