10:22官方一手arXiv: DeepSeek@Shangxuan Tian, Yanhui Chen, Carlos Queiroz在监管行业,文档分类受到数据驻留、冷启动标签有限、审查能力稀缺和模型治理程序昂贵等限制。本文提出了一种名为HIRA的训练免费、本地部署的文档分类检索增强级联方法,结合了BM25 OCR文本检索、密集文本嵌入和图像级表示。在80类贸易金融语料库上,HIRA处理了全部30,233个文档的生产流,仅请求人类对1,945个文档(6.4%)进行纠正,将宏-F1从0.6218提升到0.8548。在修正的Tobacco-3482基准上,HIRA使用本地部署的DeepSeek-R1-Distill-Qwen-32B验证器达到了0.9423的宏-F1,比零样本LLM基线高出17.4个百分点,同时仅对约40%的文档调用验证器,减少了约60%的LLM调用。通过518次人类纠正(纠正池的24.8%),HIRA与完全标记的池预言家相匹配,其中所有2,086个池文档都索引了它们的真实标签。这些结果表明,选择性人类反馈和检索记忆适应可以成为监管部署中长尾文档分类的实用替代方案。论文文档分类人机协同检索增强级联推荐理由:HIRA模型在监管行业文档分类中表现出色,通过人机协同的方式提高了分类准确率,减少了模型训练的次数,值得一看。原文稍后读已读值得跟进有用关注 文档分类
11:25官方一手arXiv: DeepSeek@Devin Pereira, Willem Zuidema精选论文研究Transformer在河内塔规划任务中的表现,发现小型自训练模型能涌现出线性可解码的几何世界模型(谢尔宾斯基三角),该模型与解题存在因果关联。对Qwen3.6-27B和DeepSeek-R1-Distill-Qwen-32B两个前沿推理模型的分析显示,它们能在提示末尾近乎完美地编码该世界模型,但圆环数超过3个时仍会在多数任务上失败。探针实验表明失败源于规划过程中世界模型表征的衰减,而非缺失。在推理时注入提示阶段的表征可部分恢复性能。论文Qwen3.6-27BDeepSeek-R1-Distill-Qwen-32B世界模型推荐理由:这篇论文说推理模型其实能建出世界模型,但解题中途就弄丢了。它用小模型和可解释性方法把问题定位得很清楚,还给出了补救办法。原文稍后读已读值得跟进有用关注 Qwen3.6-27B