10:22官方一手arXiv: DeepSeek@Shangxuan Tian, Yanhui Chen, Carlos Queiroz在监管行业,文档分类受到数据驻留、冷启动标签有限、审查能力稀缺和模型治理程序昂贵等限制。本文提出了一种名为HIRA的训练免费、本地部署的文档分类检索增强级联方法,结合了BM25 OCR文本检索、密集文本嵌入和图像级表示。在80类贸易金融语料库上,HIRA处理了全部30,233个文档的生产流,仅请求人类对1,945个文档(6.4%)进行纠正,将宏-F1从0.6218提升到0.8548。在修正的Tobacco-3482基准上,HIRA使用本地部署的DeepSeek-R1-Distill-Qwen-32B验证器达到了0.9423的宏-F1,比零样本LLM基线高出17.4个百分点,同时仅对约40%的文档调用验证器,减少了约60%的LLM调用。通过518次人类纠正(纠正池的24.8%),HIRA与完全标记的池预言家相匹配,其中所有2,086个池文档都索引了它们的真实标签。这些结果表明,选择性人类反馈和检索记忆适应可以成为监管部署中长尾文档分类的实用替代方案。论文文档分类人机协同检索增强级联推荐理由:HIRA模型在监管行业文档分类中表现出色,通过人机协同的方式提高了分类准确率,减少了模型训练的次数,值得一看。原文稍后读已读值得跟进有用关注 文档分类
09:07官方一手arXiv: DeepSeek@Muhammad Assad Shehbaz, Carlos Francisco Moreno-García该论文提出端到端管道,用于从房地产问卷文档中提取结构化数据。管道将文档分为三类:text_only、scanned和special_char,使用DeepSeek R1从合格文档中提取35个属性。在3965份文档上测试,2781份成功处理,产生2766条唯一记录。余弦相似度匹配Jaccard得分为0.82,K-Means聚类轮廓系数0.2088。论文DeepSeek R1房地产文档结构化提取推荐理由:这篇论文演示了用DeepSeek R1从杂乱文档里提取表格数据,效果不错,做房产数据或文档处理的人可以看看。原文稍后读已读值得跟进有用关注 DeepSeek R1