8月5日
11:38
11:38官方账号arXiv cs.AI@Dongjie Yang, Siyan Lin, Leixian Shen, Rui Sheng, Huamin Qu, Zixin Chen
论文提出TACT框架,用于训练和评估教学自适应的英语辅导模型。该框架包含13种辅导策略的Tutor-Strategy分类法和描述学生行为的Student-Move分类法。基于两套分类法构建的TACTCorpus覆盖260段师生对话,含32,379条标注。后训练的TACTutor在TACTBench(78个场景)上比基座模型Qwen3.5-4B提升20.30%,并在50名学习者的盲测中获得最高评分。
推荐理由:这篇论文把教学策略拆成13种,用260段真实对话和3.2万条标注训练出TACTutor,在78个测试场景比基座涨了20%,盲测还赢过商业模型。
8月1日
01:56
01:56Fireworks AI@FireworksAI_HQ
精选
Fireworks AI 在博客中建议,LoRA 表现不佳时先别急着换成更贵的全参数微调。他们用数据覆盖、优化、秩三项低成本测试,看能否缩小 LoRA 与 FullFT 的差距。在 Fireworks 的测试中,有时能缩小差距,有时不能。

推荐理由:Fireworks 试了三个便宜测试,看 LoRA 能否追平全参数微调,有时行有时不行。看完就知道先调啥。
7月31日
7月30日
7月29日
11:35
11:35Fireworks AI@FireworksAI_HQ
精选
Fireworks为DeepSeek V4 Flash新增微调能力,支持监督微调、偏好调优和组合偏好优化。用户可通过训练API进行强化学习,面向编码代理和高吞吐量生产场景。企业现可联系Fireworks(fireworks.ai/contact-traini…)使用该功能。
事件专题

推荐理由:Fireworks给DeepSeek V4 Flash加了全套微调,监督、偏好、RL都能用,专为编码场景设计,快去试试。
08:20
08:20Fireworks AI@FireworksAI_HQ
Fireworks宣布支持对Kimi K3进行微调。Kimi K3是首个3万亿参数的开源前沿模型。通过Training API,用户可进行监督微调、偏好微调和强化学习。训练支持专用和无服务器两种模式,适合产品化部署。
事件专题

推荐理由:Fireworks现在可以微调Kimi K3了,3万亿参数的开源模型,支持多种训练方式,适合定制产品。
03:10
03:10Fireworks AI@FireworksAI_HQ
Fireworks AI 宣布在其平台上支持微调 Kimi K3 模型。用户可使用自有数据训练模型,并托管在美国端点。微调后的模型权重归用户所有,且平台承诺零数据留存。无需担心数据泄露风险,直接通过 Fireworks 平台开始构建。
事件专题

推荐理由:想用自己的数据微调模型还不想把数据交给别人?Fireworks 上的 Kimi K3 能做到,权重归你,数据不留。
7月23日
12:02
12:02官方账号arXiv cs.LG@Abigail Woodring, Adrian Chan, Rana Muhammad Shahroz Khan, Sukwon Yun, Chau-Wai Wong, Tianlong Chen
论文通过Mistral、Gemma、Qwen三个基础模型的10个连续预训练步骤实验,验证了PortLLM补丁的长期时间可移植性。PortLLM是一种无需训练和数据的自适应方法,仅依赖LoRA补丁移植。理论分析表明,高维向量近正交性是时间可移植性的关键机制。研究还从损失景观几何角度比较了不同自适应选项的优劣。
推荐理由:这篇论文拆穿了为什么PortLLM的补丁隔了好几轮预训练还能用,理论部分用高维空间特性讲得特别清楚。
7月22日
17:25
17:25官方一手marktechpost@Asif Razzaq
Unsloth通过重写底层内核加速训练。Axolotl组合多种并行策略优化多GPU效率。TRL提供了被其他框架依赖的标准训练器API。LLaMA-Factory以支持最广泛的模型覆盖为目标。这四个框架均基于PyTorch和HuggingFace生态。
推荐理由:想微调LLM选框架?这篇对比了Unsloth、Axolotl、TRL和LLaMA-Factory,讲清了各自的速度、显存和多GPU表现,帮你快速决策。
08:52
08:52Fireworks AI@FireworksAI_HQ
精选
MiniMax M3 模型现已可在 Fireworks 上进行训练。用户可通过托管 LoRA SFT 和 DPO 进行标准微调。Fireworks 还提供 Training API,支持自定义 SFT、DPO 和 RL 训练循环,包含检查点、滚动推理和适配器热加载功能。
推荐理由:想 Fine-tune MiniMax M3 的话,Fireworks 现在直接支持 LoRA 和 DPO,还能自定义 RL 训练,省事不少。
03:00
02:57
02:57官方账号NVIDIA AI@NVIDIAAI
NVIDIA AI在Nemotron Labs视频中展示,对Nemotron模型进行微调前,应先用LangChain调整评估harness(测试框架)。该方法可确保微调过程更有效,避免浪费资源。视频详细演示了如何配置LangChain评估流程。
事件专题

推荐理由:NVIDIA教你怎么用LangChain先调好评估工具再调模型,很实用的小技巧,省时间少踩坑。
7月21日
09:49
09:49官方账号arXiv cs.LG@Ganapati Das, Dwipen Laskar, Hasin Afzal Ahmed, Sanjib Kr Kalita, Kshirod Sarmah, Hem Chandra Das, Manjula Kalita
该论文提出基于Whisper模型的阿萨姆语ASR系统,在Mozilla Common Voice 24.0-Assamese语料库上微调,采用混合精度训练和梯度累积优化资源受限环境。微调后词错误率(WER)降至43.17%,字符错误率(CER)13.18%,与零样本基线相比分别相对提升78.26%和93.10%。语义评估BLEU得分为30.81,METEOR为0.5262,幻觉率降低96.70%,实时因子(RTF)改善32.38%。
推荐理由:这篇论文告诉你如何微调Whisper搞定低资源语言阿萨姆语的语音识别,效果比零样本好一大截,WER直接降了78%
7月20日
09:29
09:29官方账号arXiv cs.AI@Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei, Aakash Sabharwal, Yunzhong He
CRAFT是一种新方法,将基于评分标准的评估数据集转化为模型特定弱能力诊断。它从每个提示-评分标准对中提取能力描述,聚类成层次能力树,在4个开源模型、金融和法律两个领域及13个保留基准上评估。在金融领域,CRAFT对所有4个模型的平均分超过基线;在法律领域,对4个模型中的3个表现最强。结果表明,基于评分标准诊断比基于提示或类别能更精确地定位模型弱能力,并生成更有效的微调数据。
推荐理由:CRAFT能帮你找到模型具体弱在哪里,不是笼统说不行,而是通过评分标准拆解能力,还能自动生成训练数据修bug。金融和法律测试里比随机采样效果好很多。
7月18日
12:19
12:19小互@imxiaohu
Google 推出了 gemma-trainer 工具,允许用户在本地计算机上对 Gemma 模型进行微调。该工具简化了微调流程,无需依赖云端资源。用户可以通过简单的命令或界面操作,定制自己的专属模型。具体教程链接中提供了详细步骤。
推荐理由:Google 出了个新工具 gemma-trainer,让你在自己电脑上就能微调 Gemma,不用上云,操作简单,适合想定制专属模型的朋友。
01:22
01:22官方账号NVIDIA AI@NVIDIAAI
精选
英伟达开源微调库 NeMo AutoModel 新增对 Hugging Face Diffusers 的支持。此前仅限 Transformer 模型,现在可微调图像和视频生成模型。提供即用的全参数和 LoRA 训练脚本,免去手动编写分布式训练代码的繁琐。

推荐理由:英伟达开源微调工具 AutoModel 现在也能调图像视频模型了,提供现成 LoRA 脚本,省去写分布式训练的麻烦。
7月15日
01:36
01:36Fireworks AI@FireworksAI_HQ
Fireworks AI举办免费月度DevRel网络研讨会,主题为微调开放视觉模型从杂乱收据图片中提取结构化JSON。活动将于本周四上午10点(太平洋时间)开始,全程在Fireworks平台上管理。研讨会包括近期发布介绍和微调入门指导。
推荐理由:想学怎么用Fireworks微调视觉模型处理收据数据?这个免费直播手把手教你,还能了解最新工具。
01:27
01:27官方账号NVIDIA AI@NVIDIAAI
精选
零样本模型漏检了一个可见交通信号。用 LoRA 对 Cosmos 3 Nano 进行后训练后,WTS 验证准确率从 54.41% 提升到 87.14%。结合 NVIDIA TAO AutoML,准确率进一步达到 93.35%。整个微调流程在一天内完成。
事件专题

推荐理由:NVIDIA 用 LoRA 微调小模型 Cosmos 3 Nano 做交通信号识别,准确率从 54% 蹿到 93%,一天内搞定,效果很猛。
7月11日
03:08
03:08官方账号Decoder@Matthias Bastian
76°
OpenAI的GPT-5.6 Sol模型独自对较小的Luna模型进行了后训练微调,触发方式仅为一个“相当不明确的提示词”。在OpenAI内部的RSI(递归自我改进)基准测试中,Sol的得分比GPT-5.5高出16.2分。OpenAI表示,这一进展让“自动化研究员”目标更加接近现实。
事件专题

推荐理由:OpenAI又搞事情了:GPT-5.6 Sol用一句模糊指令就能自动调教出更强的Luna,性能比上一代飙升16分,自动化研究越来越近了。
7月10日
23:56
23:56官方一手AWS Machine Learning Blog@Sandeep Raveesh-Babu
精选
本文介绍NVIDIA Nemotron 3架构的特点,并详细演示如何通过Amazon SageMaker AI的无服务器定制功能进行微调。步骤涵盖在SageMaker Studio中配置环境、加载Nemotron 3模型、调整超参数并启动训练。该方法无需管理服务器资源,支持高效迭代模型。
事件专题

推荐理由:想无服务器微调NVIDIA Nemotron 3?AWS官方教程手把手教你用SageMaker Studio搞定。