11:55官方账号arXiv cs.LG@Alberto AcedoOmega-S是一个即插即用的惩罚项,仅从权重矩阵计算,无需旧任务数据或Fisher矩阵。在Llama-3-8B上使用LoRA从代码微调到散文的实验中,Omega-S在10个种子中的9个上比无正则化保留更多原始能力。保留率从0.173提升到0.238(pass@1),即从62.9%提升到84.1%,且训练开销增加不到4%。实验表明,其实际生效机制是对节点度方差的正则化,而非名称暗示的拓扑目标。论文还量化了相同配置下保留率的标准差为0.104,并提供了全部代码和逐种子结果。论文Omega-SLlama-3-8BLoRA推荐理由:这篇论文提出了Omega-S,一个只需权重矩阵的正则项,能让微调少忘旧知识,Llama-3-8B上保留率从62.9%提到84.1%,开销只增加4%。原文稍后读已读值得跟进有用关注 Omega-S
11:38官方账号arXiv cs.AI@Dongjie Yang, Siyan Lin, Leixian Shen, Rui Sheng, Huamin Qu, Zixin Chen论文提出TACT框架,用于训练和评估教学自适应的英语辅导模型。该框架包含13种辅导策略的Tutor-Strategy分类法和描述学生行为的Student-Move分类法。基于两套分类法构建的TACTCorpus覆盖260段师生对话,含32,379条标注。后训练的TACTutor在TACTBench(78个场景)上比基座模型Qwen3.5-4B提升20.30%,并在50名学习者的盲测中获得最高评分。论文TACTQwen3.5-4BTACTutor推荐理由:这篇论文把教学策略拆成13种,用260段真实对话和3.2万条标注训练出TACTutor,在78个测试场景比基座涨了20%,盲测还赢过商业模型。原文稍后读已读值得跟进有用关注 TACT
01:56Fireworks AI@FireworksAI_HQ精选Fireworks AI 在博客中建议,LoRA 表现不佳时先别急着换成更贵的全参数微调。他们用数据覆盖、优化、秩三项低成本测试,看能否缩小 LoRA 与 FullFT 的差距。在 Fireworks 的测试中,有时能缩小差距,有时不能。技巧Fireworks AILoRA全参数微调推荐理由:Fireworks 试了三个便宜测试,看 LoRA 能否追平全参数微调,有时行有时不行。看完就知道先调啥。原文稍后读已读值得跟进有用关注 Fireworks AI
00:47a16z@a16zDecagonAI CTO Ashwin Sreenivas在a16z访谈中表示,前沿大模型与廉价小模型之间的取舍是虚假的。他说,通过针对特定任务微调较'笨'的模型,这些模型在该任务上反而能超过大型前沿模型。目前DecagonAI约90%的推理负载运行在开源模型上,并以此服务银行、航空和电信客户。他举例称,年付费10万美元的客户享受白手套服务,而年付费10美元的客户只能看帮助中心,AI可缩小这种差距。行业DecagonAI开源模型微调推荐理由:DecagonAI的CTO说,别迷信顶级模型,微调开源小模型做具体任务,又便宜又快还更好用,值得一看。原文稍后读已读值得跟进有用关注 DecagonAI
00:03Fireworks AI@FireworksAI_HQFireworks 展示了如何用对比微调将 Qwen3-Embedding-8B 适配到特定领域,成本不到 10 美元。文章给出 3 个实验,其中最好成绩 nDCG 提升 36%。作者强调,检索不到文档的重排器无法生效,RAG 也会漏掉失败案例。完整步骤和结果见 Fireworks 官方博客。技巧Qwen3-Embedding-8BFireworks微调推荐理由:Fireworks 用不到 10 美元教会你微调 Qwen3-Embedding-8B,三个实验最高 nDCG 涨 36%,做 RAG 的值得看。原文稍后读已读值得跟进有用关注 Qwen3-Embedding-8B
23:57a16z@a16z精选DecagonAI联合创始人与a16z对谈,透露其客服智能体90%运行在开源模型上。他们主张智能与便宜不是取舍,新用例先用前沿模型,成熟后迁移到开源。DecagonAI在应用层做按用例微调,降低支持成本后企业会购买更多支持服务。他们希望用AI缩小年付10万美元与10美元客户之间的客服差距。技巧DecagonAIa16z智能体推荐理由:这期访谈挺实在,DecagonAI说90%客服智能体跑在开源模型上,新场景先用贵的再用便宜的,搞微调能省成本。适合做AI应用的人听。原文稍后读已读值得跟进有用关注 DecagonAI
12:08官方一手arXiv: Anthropic@Desiree Cho, Cameron Tice, Bernie Hogan, Hunar Batra, Puria Radmard, Jun Zhao, Nigel Shadbolt72°研究团队用Anthropic宪法构建了394M token的语料,在120B规模模型上执行宪法式中期训练,并将其与后训练干净分离。2x2设计产生四个中期训练条件加一个对照,在自生成和既有基准上评估。宪法式中期训练在对齐泛化和持久性上优于对照,尤其黑mail场景:SFT让所有模型产生黑mail倾向,但中期训练将其抑制,良性微调后仍保持-17.5pp优势。这种持久性未延伸到需要主动抵抗上下文压力的场景,SFT后优势减弱。所有阶段平均无能力损失,MMLU、ARC-Easy、piqa、GSM8K得分持平。论文AnthropicConstitutional AIAI安全10 个信源在谈事件专题推荐理由:Anthropic这篇把宪法内容塞进中期训练,黑mail对齐提升17.5pp,还不掉性能。原文稍后读已读值得跟进有用关注 Anthropic
10:53官方账号arXiv cs.AI@Chuanzhi Xu, Zihan Deng, Huiqi Liang, Chengkun Yue, Zhanlin Cui, Pengfei Ye, Weidong Cai研究者构建了包含3,857个科学图表的标注数据集,每个图表按Clarity、Relevance、Informativeness、Structure四个同行评审维度评分。提出SciFigAlign模型,端到端微调CLIP和SciBERT,结合跨模态注意力与CubeMLP融合,并联合优化SmoothL1回归与论文内排名hinge损失。在论文级别划分的测试集(n=396)上,模型macro MAE为0.3524,论文内成对比对准确率达81.64%,相比最佳LLM裁判基线(MAE 0.864)实现59%的相对误差降低。消融实验证明,基于手稿、引用上下文去噪和排名监督均对评估至关重要。AI模型SciFigAlignCLIPSciBERT推荐理由:想自动给论文图表打分?SciFigAlign比顶级大模型裁判准59%,还能区分同论文哪张图更好——审稿人能省大事。原文稍后读已读值得跟进有用关注 SciFigAlign
09:35官方账号arXiv cs.LG@Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng WenROPD通过建模对齐与受损输出概率分布之间的差异,而非拟合特定提示模板,来防御恶意微调攻击。实验在三个数据集(AlpacaEval、SafetyEval、MMLU)和三个基础模型(Llama-2-7B、Mistral-7B、Vicuna-7B)上与四个基线方法(DPO、PPO、GARLIC、SALMON)对比。结果显示基线方法在模板不匹配时下游任务性能严重下降,而ROPD显著缓解模板不匹配风险,防御效果和能力保留均保持强鲁棒性。ROPD虽非完全免疫模板变化,但性能下降远小于现有方法,为LLM安全再对齐设立新标准。论文ROPDLLM安全微调推荐理由:这篇论文提出ROPD,能有效防止微调时被植入有害行为,同时不牺牲专业能力,比现有方法更能抵抗模板攻击。原文稍后读已读值得跟进有用关注 ROPD
11:43官方账号arXiv cs.LG@Tom Saliencro, Rohan Desai, Priya Nair, Maya Lindqvist, Daniel WhitmoreMixture-of-Experts (MoE) LoRA 通常对每个 token 固定激活 k 个专家,但易在简单 token 上浪费计算、难 token 上欠拟合。CARE 利用路由器输出分布作为不确定性信号,以核采样方式按置信度阈值自适应选择专家,且当已选专家分歧时小幅扩展。在 LLaMA-3.1-8B 和 Qwen2.5-7B 的 8 个常识基准、数学、代码和知识任务上,CARE 在相同计算量下优于固定 top-k MoE-LoRA,并能在激活更少专家时匹敌固定 k=4 基线。置信度与分歧信号还提升了 OOD 检测效果,超越 MSP、熵和多遍代理方法。论文CAREMoELoRA推荐理由:MoE-LoRA 不用固定 k 值了,CARE 根据 token 难度自动选专家,在 LLaMA 和 Qwen 上效率更高,还能顺手做 OOD 检测。原文稍后读已读值得跟进有用关注 CARE
11:35Fireworks AI@FireworksAI_HQ精选Fireworks为DeepSeek V4 Flash新增微调能力,支持监督微调、偏好调优和组合偏好优化。用户可通过训练API进行强化学习,面向编码代理和高吞吐量生产场景。企业现可联系Fireworks(fireworks.ai/contact-traini…)使用该功能。AI产品DeepSeek V4 FlashFireworks微调2 个信源在谈事件专题推荐理由:Fireworks给DeepSeek V4 Flash加了全套微调,监督、偏好、RL都能用,专为编码场景设计,快去试试。原文稍后读已读值得跟进有用关注 DeepSeek V4 Flash
09:22官方账号arXiv cs.LG@Jiarui Wang, Xiang Shi, Jiaqi Cao, Rubin Wei, Xiquan Wang, Hao Sun, Jingzhi Wang, Zhiqi Yang, Qipeng Guo, Bowen Zhou, Zhouhan LinMemSFT提出一种可插拔的参数化内存模块,用于在不更新骨干网络参数的情况下注入领域知识。该内存通过模仿非参数检索器在领域数据上的行为来习得知识,并可跨不同规模的LLM复用。在生成时,学习到的路由器动态融合内存和骨干网络的输出分布。在生物、地理、法律三个领域,使用Qwen3-8B到Qwen3-235B-A22B的评估显示,MemSFT显著提升领域性能且通用性能几乎无下降,而全参数微调则遭受严重的通用性能遗忘。结果表明,该方法能在参数级别分离通用能力与领域知识。AI模型MemSFTQwen3微调推荐理由:你想微调模型干专业活又怕它变傻?MemSFT加个记忆模块,领域知识涨了,通用能力不掉,比全参数微调靠谱。原文稍后读已读值得跟进有用关注 MemSFT
08:20Fireworks AI@FireworksAI_HQFireworks宣布支持对Kimi K3进行微调。Kimi K3是首个3万亿参数的开源前沿模型。通过Training API,用户可进行监督微调、偏好微调和强化学习。训练支持专用和无服务器两种模式,适合产品化部署。AI模型Kimi K3Fireworks微调10 个信源在谈事件专题推荐理由:Fireworks现在可以微调Kimi K3了,3万亿参数的开源模型,支持多种训练方式,适合定制产品。原文稍后读已读值得跟进有用关注 Kimi K3
03:10Fireworks AI@FireworksAI_HQFireworks AI 宣布在其平台上支持微调 Kimi K3 模型。用户可使用自有数据训练模型,并托管在美国端点。微调后的模型权重归用户所有,且平台承诺零数据留存。无需担心数据泄露风险,直接通过 Fireworks 平台开始构建。AI产品Kimi K3Fireworks微调10 个信源在谈事件专题推荐理由:想用自己的数据微调模型还不想把数据交给别人?Fireworks 上的 Kimi K3 能做到,权重归你,数据不留。原文稍后读已读值得跟进有用关注 Kimi K3
17:50Amjad Masad@amasad开发者Amjad Masad发现,训练chess LLM从棋盘局面到走子对时遭遇收益递减。意外中,一个“先思考再走子”分支虽然产生幻走,但混合约8%的推理轨迹到纯走子数据后,在相同预算下效果超过纯走子数据。模型内化了推理过程,但推理时不显式使用。新部署的象棋引擎估计约1200 Elo,目标是达到2000+,且保持小规模微调LLM、无引擎辅助的约束。技巧Amjad Masadchess LLM推理模型推荐理由:这个意外发现很有意思:混一点点推理数据,不改变推理过程,象棋AI就变强了。适合研究模型训练技巧的人。原文稍后读已读值得跟进有用关注 Amjad Masad
12:02官方账号arXiv cs.LG@Abigail Woodring, Adrian Chan, Rana Muhammad Shahroz Khan, Sukwon Yun, Chau-Wai Wong, Tianlong Chen论文通过Mistral、Gemma、Qwen三个基础模型的10个连续预训练步骤实验,验证了PortLLM补丁的长期时间可移植性。PortLLM是一种无需训练和数据的自适应方法,仅依赖LoRA补丁移植。理论分析表明,高维向量近正交性是时间可移植性的关键机制。研究还从损失景观几何角度比较了不同自适应选项的优劣。论文PortLLMLoRA微调推荐理由:这篇论文拆穿了为什么PortLLM的补丁隔了好几轮预训练还能用,理论部分用高维空间特性讲得特别清楚。原文稍后读已读值得跟进有用关注 PortLLM
17:25官方一手marktechpost@Asif RazzaqUnsloth通过重写底层内核加速训练。Axolotl组合多种并行策略优化多GPU效率。TRL提供了被其他框架依赖的标准训练器API。LLaMA-Factory以支持最广泛的模型覆盖为目标。这四个框架均基于PyTorch和HuggingFace生态。AI模型UnslothAxolotlTRL推荐理由:想微调LLM选框架?这篇对比了Unsloth、Axolotl、TRL和LLaMA-Factory,讲清了各自的速度、显存和多GPU表现,帮你快速决策。原文稍后读已读值得跟进有用关注 Unsloth
08:52Fireworks AI@FireworksAI_HQ精选MiniMax M3 模型现已可在 Fireworks 上进行训练。用户可通过托管 LoRA SFT 和 DPO 进行标准微调。Fireworks 还提供 Training API,支持自定义 SFT、DPO 和 RL 训练循环,包含检查点、滚动推理和适配器热加载功能。AI模型MiniMax M3FireworksLoRA推荐理由:想 Fine-tune MiniMax M3 的话,Fireworks 现在直接支持 LoRA 和 DPO,还能自定义 RL 训练,省事不少。原文稍后读已读值得跟进有用关注 MiniMax M3
03:00Fireworks AI@FireworksAI_HQ精选Heidi团队不再租用第三方模型,选择微调一个开源模型。在内部评估中,该模型质量超越Gemini Pro。延迟从25秒降至7秒,速度提升3.5倍。从概念验证到生产部署仅用4周。AI模型HeidiGemini Pro微调推荐理由:Heidi自己微调开源模型,质量居然比Gemini Pro还好,速度还快了3.5倍,4周就上线,太强了。原文稍后读已读值得跟进有用关注 Heidi
02:57官方账号NVIDIA AI@NVIDIAAINVIDIA AI在Nemotron Labs视频中展示,对Nemotron模型进行微调前,应先用LangChain调整评估harness(测试框架)。该方法可确保微调过程更有效,避免浪费资源。视频详细演示了如何配置LangChain评估流程。技巧NemotronLangChainNVIDIA3 个信源在谈事件专题推荐理由:NVIDIA教你怎么用LangChain先调好评估工具再调模型,很实用的小技巧,省时间少踩坑。原文稍后读已读值得跟进有用关注 Nemotron
12:03官方账号arXiv cs.LG@Hang Zhang, Warren J. GrossPPL-Factory提出了基于困惑度(perplexity)的任务感知和预算感知数据选择框架,用于大语言模型微调。在GSM8K上仅用1%训练数据即超越现有最佳方法;用10%数据在GSM8K上超过全量微调0.9个点,在MATH上超出4.8个点。该方法通过区分语言建模与推理任务的不同学习目标,实现高效且可解释的数据筛选。论文PPL-Factory数据选择微调推荐理由:想省训练成本又想模型推理更强?PPL-Factory用10%数据在MATH上比全量微调高4.8,门槛低、效果还更炸。原文稍后读已读值得跟进有用关注 PPL-Factory
10:01官方账号arXiv cs.AI@Yunze Han研究者对Qwen2.5-Coder-7B-Instruct模型在SWE-trajectory数据集(67,074条轨迹,32,161条已解决)上进行LoRA微调,提出效率和风格两维度质量评分框架,并通过16组对照实验分析策略、规模与消融。在7B模型SWE-bench解决率近零的情况下,采用交叉熵损失替代评估,发现其与ROUGE-L完全秩相关(Spearman ρ=-1.00)。结果揭示规模依赖的质量-数量权衡:500到1000条时数据翻倍降低约12.7%损失,但TopQ与随机差距小于1%;2000条时差距扩大到3.6%(p=0.016)。消融实验确认错误重试率是主导子维度,表现与完整复合指标相当(Δ<0.2%)。论文Qwen2.5-CoderLoRASWE-trajectory推荐理由:这篇论文系统测试了用SWE-trajectory数据微调Qwen2.5-Coder时,不同轨迹筛选方法的效果,发现数据质量和数量在不同规模下影响不同,值得参考。原文稍后读已读值得跟进有用关注 Qwen2.5-Coder
09:49官方账号arXiv cs.LG@Ganapati Das, Dwipen Laskar, Hasin Afzal Ahmed, Sanjib Kr Kalita, Kshirod Sarmah, Hem Chandra Das, Manjula Kalita该论文提出基于Whisper模型的阿萨姆语ASR系统,在Mozilla Common Voice 24.0-Assamese语料库上微调,采用混合精度训练和梯度累积优化资源受限环境。微调后词错误率(WER)降至43.17%,字符错误率(CER)13.18%,与零样本基线相比分别相对提升78.26%和93.10%。语义评估BLEU得分为30.81,METEOR为0.5262,幻觉率降低96.70%,实时因子(RTF)改善32.38%。论文WhisperAssameseASR推荐理由:这篇论文告诉你如何微调Whisper搞定低资源语言阿萨姆语的语音识别,效果比零样本好一大截,WER直接降了78%原文稍后读已读值得跟进有用关注 Whisper
09:29官方账号arXiv cs.AI@Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei, Aakash Sabharwal, Yunzhong HeCRAFT是一种新方法,将基于评分标准的评估数据集转化为模型特定弱能力诊断。它从每个提示-评分标准对中提取能力描述,聚类成层次能力树,在4个开源模型、金融和法律两个领域及13个保留基准上评估。在金融领域,CRAFT对所有4个模型的平均分超过基线;在法律领域,对4个模型中的3个表现最强。结果表明,基于评分标准诊断比基于提示或类别能更精确地定位模型弱能力,并生成更有效的微调数据。论文CRAFT微调能力诊断推荐理由:CRAFT能帮你找到模型具体弱在哪里,不是笼统说不行,而是通过评分标准拆解能力,还能自动生成训练数据修bug。金融和法律测试里比随机采样效果好很多。原文稍后读已读值得跟进有用关注 CRAFT
09:15官方一手marktechpost@Sana Hassan精选该教程展示了如何在Google Colab单GPU上使用NVIDIA NeMo AutoModel微调Qwen3-0.6B模型。从验证CUDA硬件开始,安装NeMo AutoModel源码,加载官方LoRA配置。在受限运行时调整精度、批次大小、检查点和调度器设置。通过automodel CLI启动微调,加载LoRA检查点后比较基础模型与微调输出的差异。最后演示NeMoAutoModelForCausalLM Python API的使用。技巧Qwen3LoRANeMo AutoModel2 个信源在谈事件专题推荐理由:教你用Colab单GPU跑Qwen3-0.6B的LoRA微调,全程实操,从环境配置到API调用都有,适合想上手NeMo的低资源玩家。原文稍后读已读值得跟进有用关注 Qwen3
12:19小互@imxiaohuGoogle 推出了 gemma-trainer 工具,允许用户在本地计算机上对 Gemma 模型进行微调。该工具简化了微调流程,无需依赖云端资源。用户可以通过简单的命令或界面操作,定制自己的专属模型。具体教程链接中提供了详细步骤。技巧Gemmagemma-trainerGoogle推荐理由:Google 出了个新工具 gemma-trainer,让你在自己电脑上就能微调 Gemma,不用上云,操作简单,适合想定制专属模型的朋友。原文稍后读已读值得跟进有用关注 Gemma
01:22官方账号NVIDIA AI@NVIDIAAI精选英伟达开源微调库 NeMo AutoModel 新增对 Hugging Face Diffusers 的支持。此前仅限 Transformer 模型,现在可微调图像和视频生成模型。提供即用的全参数和 LoRA 训练脚本,免去手动编写分布式训练代码的繁琐。AI产品AutoModelDiffusers微调推荐理由:英伟达开源微调工具 AutoModel 现在也能调图像视频模型了,提供现成 LoRA 脚本,省去写分布式训练的麻烦。原文稍后读已读值得跟进有用关注 AutoModel
00:10AI Engineer@aiDotEngineer精选在 AIE Europe 会议上,Google DeepMind 团队展示了一个完整微调流程:以 Gemma 270M 模型为起点,通过生成合成任务数据、LoRA 微调、int4 量化,最终部署到 Pixel 手机上。整个流程仅需 21 分钟,准确率从 46% 提升至 90%,推理速度达到 2000 tokens/s。该方法对比 1500 美元的线下 AI 训练营有显著效率和成本优势。技巧GemmaLoRA量化推荐理由:Google 工程师教你怎么在手机上 21 分钟微调一个小模型,从 46% 干到 90%,比花 1500 美元买课还快。原文稍后读已读值得跟进有用关注 Gemma
09:41官方账号arXiv cs.AI@Vladimir Fedosov, Aleksandr Sazhin, Artemiy Grinenko, Frank Woernle研究者提出分层全局注意力(HGA),结合分段反向传播和分层KV存储,仅保留当前段在VRAM中可微分,历史KV卸载到RAM或NVMe。在Qwen3-8B上使用4位QLoRA,PG19数据集,16GB Quadro RTX 5000上HGA达到16384训练长度,峰值显存15.28GB,而密集训练仅支持2048令牌。相同适配器可处理131072令牌推理。2K训练长度下,HGA与密集训练困惑度分别为2.7405和2.7383 nat,基线模型为2.9541;HGA训练速度略快(217.75 vs 207.02 tokens/s)。AI模型Qwen3-8BHGA长上下文推荐理由:Qwen3-8B长上下文微调显存不够?HGA方案在16GB卡上跑16384令牌,比密集训练省显存还快一点,代码正在路上。原文稍后读已读值得跟进有用关注 Qwen3-8B
02:06Fireworks AI@FireworksAI_HQFireworks AI 举办免费 DevRel 网络研讨会,演示如何微调开源视觉模型从混乱收据图片中提取结构化 JSON。整个过程在 Fireworks 平台上端到端管理。研讨会已于 10am PST 开始,无法参加的观众可在本周内观看 YouTube 回放。活动还涵盖近期发布和微调入门指南。技巧Fireworks AI微调开源模型推荐理由:想学微调?Fireworks 现场演示用视觉模型从收据扒 JSON,实操干货,错过也有回放。原文稍后读已读值得跟进有用关注 Fireworks AI
03:57The Rundown AI@therundownai精选Thinking Machines 推出了其首个模型 Inkling,这是一个开源权重的多模态系统。Inkling 拥有高达 100 万 token 的上下文窗口,能够原生处理文本、图像和音频,并支持可控思考努力。完整权重已在 Hugging Face 上公开,并可通过 Tinker 平台进行微调。团队表示 Inkling 不是整体最强的模型,但专为定制化而设计。AI模型Thinking MachinesInkling多模态10 个信源在谈事件专题推荐理由:想找个能处理百万 token 多模态、还能自己微调的开源模型?Inkling 刚上线,权重直接开放,值得试试。原文稍后读已读值得跟进有用关注 Thinking Machines
03:46Suhail@Suhail精选Thinking Machines 今日推出多模态模型 Inkling,支持文本、图像和音频三种模态的高效推理。该模型完全权重开放,允许用户在 Tinker 平台上进行微调。官方同时提供 Inkling Playground 供用户体验。这一发布标志着后训练基础设施即服务的垂直整合进入新阶段。AI模型InklingThinking Machines多模态10 个信源在谈事件专题推荐理由:Inkling 能同时处理文本、图像和音频,权重全开放还能自己微调,去 Playground 玩一把就知道了。原文稍后读已读值得跟进有用关注 Inkling
01:36Fireworks AI@FireworksAI_HQFireworks AI举办免费月度DevRel网络研讨会,主题为微调开放视觉模型从杂乱收据图片中提取结构化JSON。活动将于本周四上午10点(太平洋时间)开始,全程在Fireworks平台上管理。研讨会包括近期发布介绍和微调入门指导。技巧Fireworks视觉模型微调推荐理由:想学怎么用Fireworks微调视觉模型处理收据数据?这个免费直播手把手教你,还能了解最新工具。原文稍后读已读值得跟进有用关注 Fireworks
01:27官方账号NVIDIA AI@NVIDIAAI精选零样本模型漏检了一个可见交通信号。用 LoRA 对 Cosmos 3 Nano 进行后训练后,WTS 验证准确率从 54.41% 提升到 87.14%。结合 NVIDIA TAO AutoML,准确率进一步达到 93.35%。整个微调流程在一天内完成。AI模型NVIDIACosmos 3 NanoLoRA10 个信源在谈事件专题推荐理由:NVIDIA 用 LoRA 微调小模型 Cosmos 3 Nano 做交通信号识别,准确率从 54% 蹿到 93%,一天内搞定,效果很猛。原文稍后读已读值得跟进有用关注 NVIDIA
08:52官方一手marktechpost@Asif Razzaq精选Thinking Machines Lab发布论文《The Future Worth Building Is Human》,将人类参与和模型所有权纳入技术挑战。论文以Tinker的LoRA微调为例,说明团队可训练并保留自己的模型权重。该方法强调去中心化对齐,允许用户控制模型行为。交互模型被重新设计以支持个性化调整。论文Thinking Machines LabMira MuratiLoRA推荐理由:Mira Murati的新实验室发了篇论文,讲怎么让用户自己掌握模型权重,还拿LoRA举例,挺接地气的。原文稍后读已读值得跟进有用关注 Thinking Machines Lab
04:50官方账号Allen AI (Ai2)@allen_aiAi2研究科学家pjreddie解释合作伙伴如何定制OlmoEarth模型。OlmoEarth是开源地球观测模型,通过微调可在地图作物和野火风险等任务上提升性能。嵌入方法只能达到一定效果,微调是下一个性能提升的关键。该模型基于卫星图像训练,支持多种地理空间应用。AI模型OlmoEarthAi2微调推荐理由:Ai2的OlmoEarth模型开源了,微调比嵌入效果更好,能用来做作物映射和野火预测,实用性强。原文稍后读已读值得跟进有用关注 OlmoEarth
03:08官方账号Decoder@Matthias Bastian76°OpenAI的GPT-5.6 Sol模型独自对较小的Luna模型进行了后训练微调,触发方式仅为一个“相当不明确的提示词”。在OpenAI内部的RSI(递归自我改进)基准测试中,Sol的得分比GPT-5.5高出16.2分。OpenAI表示,这一进展让“自动化研究员”目标更加接近现实。AI模型GPT-5.6 SolLunaOpenAI10 个信源在谈事件专题推荐理由:OpenAI又搞事情了:GPT-5.6 Sol用一句模糊指令就能自动调教出更强的Luna,性能比上一代飙升16分,自动化研究越来越近了。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
23:56官方一手AWS Machine Learning Blog@Sandeep Raveesh-Babu精选本文介绍NVIDIA Nemotron 3架构的特点,并详细演示如何通过Amazon SageMaker AI的无服务器定制功能进行微调。步骤涵盖在SageMaker Studio中配置环境、加载Nemotron 3模型、调整超参数并启动训练。该方法无需管理服务器资源,支持高效迭代模型。技巧NVIDIANemotron 3Amazon SageMaker7 个信源在谈事件专题推荐理由:想无服务器微调NVIDIA Nemotron 3?AWS官方教程手把手教你用SageMaker Studio搞定。原文稍后读已读值得跟进有用关注 NVIDIA
17:10Stanford AI Lab@StanfordAILab精选斯坦福AI Lab提出Distill to Detect(D2D)方法,通过蒸馏微调模型与基座模型的差异到小型“子弹”中,放大隐蔽偏见至生成文本,使现有审计工具(如训练集探测)能检测到。论文显示D2D在单个未知主题上可揭露30%以上的隐藏偏好,且无需预知偏见方向。该方法为模型审计提供了系统性的未知偏见发现手段。论文Stanford AI LabD2D微调推荐理由:想查你的微调模型有没有偷偷偏向某件事?D2D把模型差异蒸馏出来放大,让你抓到那些连你都不知道要找的偏见。原文稍后读已读值得跟进有用关注 Stanford AI Lab
11:44官方账号arXiv cs.LG@Shreyas Subramanian, Adewale Akinfaderin, Akarsha Sehwag论文检验了LLM中“超级权重”(单参数移除后性能骤降)的存在性,发现这并非所有模型通用。在OLMo-1B和OLMo-7B上,单独训练100到8192个超级权重参数,精度降至随机猜测水平;即便扩展至周围36000个参数也无改善。相比之下,随机选取同层同等数量参数训练反而能提升基准。使用仅占0.16%参数的vanilla LoRA(更新注意力权重矩阵)成功微调,且施加于超级权重坐标的LoRA约束效果类似。结论指出参数重要性不等同于单独可训练性,有效微调需要基于全层的结构化分解。论文Super WeightLoRAOLMo推荐理由:这篇论文打脸了“超级权重”的主张:单独训练它们反而让模型崩成随机猜,而LoRA用极少的参数就能搞定。想了解模型微调真正该关注什么,必看。原文稍后读已读值得跟进有用关注 Super Weight