09:29官方账号arXiv cs.LG@Brendan Smith, Susana Lopez-Moreno, Eric Dolores-Cuenca, Sangil Kim, Jose L. Mendoza-Cortes, Nijamudheen AbdulrahimanCheMLFlow 是一个开源平台,用于构建和执行端到端、高通量及智能体驱动的科学工作流。它提供模块化组件、可运行参考管线、标准化产物和评估输出,降低多步骤机器学习管线的编排成本。该平台支持可插拔表示与模型、确定性数据划分、批处理执行和报告生成,并面向智能体辅助实验设计提供了配置驱动接口。论文展示了在量子力学、物理化学和生物活性性质预测基准上达到文献水平的结果,并给出时间序列数据集上超越分子化学的应用案例。论文CheMLFlow化学信息学材料信息学推荐理由:做科学 ML 的人可以看看这个,它把数据、训练、筛选、报告都串成现成管线,省去自己拼装的麻烦,还自带基准结果。原文稍后读已读值得跟进有用关注 CheMLFlow
11:43官方账号arXiv cs.LG@David Ming Segura, Jeremy Goumaz, Joshua W. Sin, Bojana Ranković, Philippe SchwallerCheMatE是一个基于ModernBERT的化学嵌入模型,在同一个向量空间中联合表示SMILES分子结构和化学领域自然语言。训练分两步:先在大规模SMILES标注科学文档上继续掩码语言建模,语料来自FineWeb和ChemPile,分别含10.4B和11.5B token;再用Multiple Negative Ranking Loss进行Matryoshka对比学习。模型在分子性质预测和科学语言理解任务上测试,效果与专用化学模型和通用语言模型基线相当。AI模型CheMatESMILESModernBERT推荐理由:CheMatE让模型同时懂SMILES和化学文献,两阶段训练后在分子性质预测和科学理解任务上都不输基线。原文稍后读已读值得跟进有用关注 CheMatE
12:34官方账号arXiv cs.AI@Xinni Zhang, Zijing Liu, He Cao, Yu Li, Irwin King精选针对SMILES字符串的Transformer模型存在局部性缺陷:标准字符级分词会破坏化学上有意义的基团,迫使模型重复学习局部语法而忽略长程依赖。MolGram通过条件n-gram记忆模块,将局部字符串模式映射为可学习的嵌入向量,并动态注入隐藏状态,在不破坏标准分词器的情况下解决该问题。在无条件分子生成、正向反应预测和单步逆合成三个任务上,MolGram一致提升性能,且仅用1/3参数即可超越基线模型。该工作表明,显式局部模式记忆是一种高效的归纳偏置,尤其适合化学信息学场景。论文分子语言模型n-gram记忆SMILES推荐理由:做分子生成或逆合成预测的团队,MolGram用更少参数就能超越3倍大模型,值得在自家任务上试试。原文稍后读已读值得跟进有用关注 分子语言模型