18:09官方账号arXiv cs.AI@Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan, Tu Vu精选73°WikiSkill框架通过将执行经验、积累知识和可执行技能分离,持续将经验整合到知识库中。该框架在多个基准测试和模型上表现优于最先进的技能进化方法,在大多数模型-基准设置中优于无技能基线。研究发现技能进化与模型扩展互补:大模型通常从进化技能中获益更多,而有技能的小模型可以显著超越无技能的大模型。技能在不同模型和模型家族间能有效转移,其他模型进化的技能甚至可以超越自我进化的技能。AI模型WikiSkill智能体技能进化1 个信源在谈事件专题推荐理由:WikiSkill让AI智能体把经验变成可复用的知识库,小模型靠技能能打败大模型,技能还能跨模型使用。原文稍后读已读值得跟进有用关注 WikiSkill
04:25官方一手AWS Machine Learning Blog@Mona MonaAmazon SageMaker AI 发布容器镜像缓存功能,针对推理场景优化扩展速度。该功能在模型扩缩容时可将端到端延迟最高提升2倍。它专为生成式AI模型设计,减少冷启动时间。现已可在AWS区域使用。AI产品SageMaker AI容器缓存模型扩展推荐理由:AWS给SageMaker AI加了容器缓存,扩展时延迟直接减半,适合需要快速响应的生成式AI部署。原文稍后读已读值得跟进有用关注 SageMaker AI
10:33官方账号arXiv cs.LG@Rohan Shravan精选72°该论文报告了在单个8GPU节点上端到端训练千亿参数稀疏混合专家模型的方法。LightningLM 0.1V 是一个基于循环骨干的语言模型家族,从小型稠密种子模型逐步扩展至120B参数、460个路由专家(top-12路由)。通过状态保持扩展策略,每个更大模型从小模型的训练权重生长而来,活跃参数从1.78B单调增长至5.93B。关键创新包括:可逆循环栈使激活内存不随模型增长而增加;状态保持扩展原则确保各阶段扩展不失败;单节点经济策略TQP通过量化基专家权重和训练低秩适配器,将优化器状态从100B+压缩至2.26B参数。模型家族、分词器和训练代码均已开源。论文稀疏MoE模型扩展可逆循环推荐理由:这篇论文解决了大模型训练资源门槛高的问题——单节点8卡就能训120B模型,做MoE和模型扩展的团队可以直接参考其状态保持原则和TQP策略,省下大量硬件成本。原文稍后读已读值得跟进有用关注 稀疏MoE