09:04官方账号arXiv cs.LG@Mushir Akhtar, M. Tanveer, Mohd. ArshadResidual-Guided Randomized Neural Networks 提出了一种残差引导的隐藏层构建方法。该方法通过封闭形式残差减少标准评估候选单元,在71个UCI基准数据集上测试。新方法在准确性、稳定性和整体排名性能上均优于基线模型。论文Residual-Guided Randomized Neural Networks神经网络UCI推荐理由:UCI数据集验证,残差引导方法让随机神经网络训练更高效准确。原文稍后读已读值得跟进有用关注 Residual-Guided Randomized Neural Networks
10:07官方账号arXiv cs.LG@Weihao Qu, Ling Zheng, Dongyang Wang, Jiacun Wang, Haowen Pan针对AECOPD症状变化快速,现有模型存在延迟问题,本文提出一种基于时间感知Transformer的预测模型,利用日常呼吸机数据,捕捉症状及其时间进程,实验结果表明,该方法在多个分类任务中优于传统方法,有望提高AECOPD预测准确性。论文AECOPD预测模型时间感知Transformer呼吸机数据推荐理由:这篇论文提出了一种新的AECOPD预测模型,利用日常呼吸机数据,比传统方法更准确,值得关注。原文稍后读已读值得跟进有用关注 AECOPD预测模型
02:56官方账号Greg Brockman@gdb精选开发者Greg Kamradt用GPT-5.6 Luna的批处理模式完成了一个包含78K种分类的研究项目。整个任务产生了158K个请求,消耗143M输入token。借助每百万token 0.10美元的批量价格,总费用仅为60美元。这个案例展示了如何用夜间批处理大幅降低大规模分类任务的成本。技巧GPT-5.6 Luna批处理token成本推荐理由:Greg用GPT-5.6 Luna跑了一夜,143M token只花了60刀,批量模式真的省。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna
09:47官方账号arXiv cs.LG@Zeynep Türkmen, Kürşat Kaya, Alexander Pfefferle, Frank Hutter该研究提出一个统一接口,用于比较不同表格基础模型的数据先验。他们从TabPFN、TabR等公开先验和真实数据集生成训练任务,在固定架构和训练协议下训练模型。在共享下游分类任务上评估发现不同先验偏好不同任务特性,部分先验绝对性能更强,部分排序更稳定。数据级相似度仅能部分解释下游行为差异。论文表格基础模型数据先验评估方法推荐理由:想知道不同表格基础模型的数据先验到底差多少?这篇论文用统一框架帮你测了一遍,结果挺有意思。原文稍后读已读值得跟进有用关注 表格基础模型
09:38官方账号arXiv cs.AI@Sercan Karakaş, Yusuf Şimşek该研究针对土耳其语中具有歧义的轻动词结构(LVC)进行分类,区分其字面义与习语义。研究者对比了监督学习模型(BERTurk)与三种指令微调大语言模型(LLM)在零样本、单样本和少样本提示下的表现。结果显示,零样本下LLM对LVC召回率低,单样本提示虽提升检测但引入模型特定偏差,而少样本提示能改善校准。最终,监督基线仍具竞争力,但精心设计的示例可使LLM在LVC分类上达到或超越监督模型。论文多词表达土耳其语上下文学习推荐理由:这项研究揭示了提示设计对多词表达分类的关键影响,做自然语言处理尤其是低资源语言语义分析的团队值得关注,直接参考其示例构建策略可提升模型效果。原文稍后读已读值得跟进有用关注 多词表达
12:49官方一手arXiv: OpenAI@M. Mikail Demir, M. Abdullah Canbaz精选该论文针对法律先例中负面处理的自动分类任务,提出了一种更稳健的评估框架。研究基于一个由专家标注的239个真实法律引用数据集,并引入新的平均严重性错误指标来衡量分类错误的实际影响。实验显示,Google的Gemini 2.5 Flash在高层次分类任务中准确率最高(79.1%),而OpenAI的GPT-5-mini在更复杂的细粒度分类中表现最佳(67.7%)。这项工作为法律领域的NLP任务建立了关键基线,并提供了新的评估工具。论文法律NLPLLM评估分类任务7 个信源在谈事件专题推荐理由:法律科技团队终于有了针对负面处理分类的专门评估框架——新指标和数据集能更真实反映错误风险,做法律文档自动化的开发者建议直接参考。原文稍后读已读值得跟进有用关注 法律NLP