7月7日
03:01
03:01AK@_akhaliq
精选
bottlecapai 基于 Qwen3.6-27B 微调推出 ThinkingCap-Qwen3.6-27B 模型,平均推理 token 减少 50%,最佳案例减少 90% 以上。该模型通过先进微调算法在多个领域和难度的问题集上训练。

推荐理由:bottlecapai 用 Qwen3.6-27B 微调的新模型能省一半推理 token,最快省九成,适合低成本推理场景。
7月4日
08:48
08:48官方账号Stability AI@StabilityAI
精选
团队 Motif 在 Stable Audio 3.0 上微调,使其识别阿拉伯 maqam 音阶。他们开发了一个 Ableton 插件,实现微音阶风格转移。该作品在 StabilityAI 举办的 Stable Audio 3.0 挑战赛中获胜,并能在本地设备运行。演示视频由 Jad Al Masri 讲解。

推荐理由:StabilityAI 挑战赛冠军团队 Motif 把 Stable Audio 3.0 微调后做成了 Ableton 插件,专门处理阿拉伯音乐微音阶,本地就能跑。
7月3日
11:54
11:54官方账号arXiv cs.AI@Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng
精选
PAW(Program-as-Weights)提出一种模糊函数编程范式,将自然语言规范编译为紧凑的本地可执行神经构件。一个4B编译器在FuzzyBench(1000万示例)上训练,为冻结的0.6B Qwen3解释器生成参数高效适配器。该解释器执行PAW程序,性能匹配直接提示Qwen3-32B,但推理内存仅为其1/50,在MacBook M3上达30 tokens/s。PAW将基础模型从逐输入求解器转变为可复用小工具构建器。
推荐理由:PAW让模糊函数(如日志告警、修复JSON)不再依赖大模型API。用4B编译器一次编译,0.6B小模型就能跑出32B的效果,还省内存和算力。
04:01
04:01The Rundown AI@therundownai
精选
Mira Murati的Thinking Machines Lab与全球最大对冲基金Bridgewater合作,测试AI用于投资新闻筛选。GPT、Claude、Gemini在六项过滤测试中平均准确率约50%。专家投资者编写提示词后准确率升至74-76%,但仍低于80%的信任阈值。通过TML的Tinker API微调开放权重模型,准确率达到84.7%,错误率比最佳前沿模型降低29.8%,且每任务成本仅为前者的1/13.8。
事件专题

推荐理由:Mira Murati团队和桥水基金一起搞了个AI筛选新闻的实验,先用GPT、Claude只有50%准确率,专家写提示词到75%还是不够,最后微调模型干到了84.7%,成本还低了13倍多。
7月1日
10:33
10:33官方账号arXiv cs.AI@Ekaterina Alimaskina, Denis Shveykin, Gleb Molodtsov, Igor Shalygin, Alexey Kadeishvili, Aleksandr Beznosikov
语言模型越来越多地使用自生成的问答数据来微调或蒸馏。研究表明,生成阶段并非中性预处理,而是隐含策略:模型在提问时不会均匀扫描文档,覆盖很快饱和并集中在显著区域,不同提示也会聚焦相同片段。在回答阶段,模型倾向于服从文本中嵌入的指令性内容,且这种服从取决于指令的表面形式和意图。作者通过将每个问题固定到特定目标降低了选择偏差,并在回答前过滤指令性文本,将注入合规率从88%降至13%,同时保留几乎所有干净文本。
推荐理由:这篇论文告诉你,用模型自己问自己生成的问答数据来训练模型,可能会引入隐蔽的偏见和指令注入风险。他们用一个简单方法就能把问题率从88%压到13%,值得做数据合成的同学看看。
01:23
01:23官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA TAO 7 允许用户用自然语言向编码代理描述需求,自动执行模型调优。其 Agent 技能可接入编码代理并提升准确率,AutoML 自动搜索超参数,LLM 引导调优比传统方法快 2 倍。支持在本地 NVIDIA GPU 上微调任何 Hugging Face 的 CV 或 VLM 模型,数据增强微调能帮助代理识别失败原因并修复。
事件专题

推荐理由:NVIDIA 发布了 TAO 7,你只需用大白话告诉编码代理要啥,它就能自己调模型,比手动调参快两倍,还能本地跑 Hugging Face 模型。
6月30日
11:39
11:13
11:13官方账号arXiv cs.LG@Boshko Koloski, Xiangjian Jiang, Senja Pollak, Blaž Škrlj, Mateja Jamnik, Nikola Simidjievski
论文针对TabPFN和TabICL等纳米级表格基础模型,提出KnowsTFM方法,通过知识图谱的结构注意力先验和参数高效低秩更新进行微调。在数据稀缺、高维且分布偏移的专业领域,KnowsTFM相比原始变体取得显著提升,但在通用任务上增益微小。研究还发现,对前沿模型持续微调可能导致预训练知识及机制崩溃。
推荐理由:这篇论文教你用小知识图谱提升小表格模型在专业领域的效果,比普通微调更靠谱,还揭示了持续微调的风险。
6月26日
08:55
08:55Fireworks AI@FireworksAI_HQ
精选
Fireworks 宣布对 NVIDIA Nemotron 3 的强化学习微调功能上线,首批支持 Nemotron 3 Super 的 LoRA 微调。训练采用 GRPO 算法,可在一处平台完成训练和部署。计费方式改为按 GPU 小时而非按 token,解决了长多轮对话成本不可控的问题。
事件专题

推荐理由:Fireworks 刚上线了 Nemotron 3 的 RL 微调,按 GPU 小时计费不怕长对话烧钱,用 GRPO 训练一条龙搞定。
04:52
04:52官方账号LangChain@LangChainAI
LangChain与Fireworks AI合作,基于阿里巴巴Qwen模型微调了一个法官模型。该模型用于检测用户交互中的“感知错误”(Perceived Error)。具体微调方法和评估结果已在LangChain博客文章中发布。
推荐理由:LangChain和Fireworks用Qwen搞了个裁判模型,专门抓对话里的感知错误,挺实用的,去博客看具体数据吧。
6月25日
00:51
00:51官方一手Hugging Face: Blog博客/媒体
精选
NVIDIA 发布 NeMo AutoModel,通过自动化模型并行、混合精度训练和梯度检查点,简化 Transformer 模型微调流程。该工具可自动检测硬件配置,支持多 GPU 分布式训练,无需手动调整参数。在微调 BERT-base 模型时,相比标准 PyTorch 实现,NeMo AutoModel 将训练时间缩短约 40%,并保持相同精度。
事件专题

推荐理由:NVIDIA 搞了个 NeMo AutoModel,能自动帮你加速微调 Transformer 模型,省去手动调参的麻烦,速度还快很多,适合想快速出结果的人。
6月24日
12:10
12:10官方账号arXiv cs.AI@Ahmad Pouramini, Hesham Faili
该论文提出MTO框架,在编码器-解码器预训练语言模型上匹配任务与预训练目标。将微调模板与目标对齐后,在少样本设置下性能提升超过120%,并超越相关研究。在全数据集场景中也优于基线。框架还扩展至提示调优,提供软提示工程与优化的指导。
推荐理由:这篇论文教你怎么给不同任务选对预训练目标,少样本下性能直接翻倍,比传统方法强一大截。
6月23日
22:09
22:09官方账号LangChain@LangChainAI
精选76°
LangChain与Fireworks AI合作,微调阿里Qwen模型构建了trace judge,用于检测生产trace中的“感知错误”。该judge在性能上匹敌或超越前沿模型,同时运行成本降低100倍。相关研究成果已发表在LangChain Labs博客。
推荐理由:LangChain搞了个低成本trace judge,用阿里Qwen微调,性能不输顶级模型还便宜100倍,做trace监控的可以看看。
6月18日
03:55
03:55官方账号LangChain@LangChainAI
LangChain测试显示,Alibaba Qwen基础模型配合良好提示在感知错误分类任务上性能接近前沿模型。使用LoRA SFT微调后,模型性能接近或超过前沿模型。实验表明微调能使开源模型与顶级闭源模型竞争。

推荐理由:LangChain实测:Qwen基础版+好提示就能追平顶级模型,微调后甚至超越。开源模型潜力很大!
6月17日
10:17
10:17官方账号arXiv cs.LG@SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee
论文发现LLM在多项选择问答中早期存在信念漂移,违背鞅性质。通过提出的提示预测重采样(PPR)方法,模型在多次重采样后信念自稳定并收敛。基于此,研究者进一步提出种子答案提示策略和自一致性损失微调方法。在多项选择QA基准测试中,这些方法显著减少信念漂移并提高预测一致性,且不牺牲准确性。
推荐理由:这篇论文发现了LLM回答重复问题时信念会自己稳定,还给了两种让模型更一致的方法,适合关注推理可靠性的读者。
09:34
09:34Fireworks AI@FireworksAI_HQ
Kimi 2.7 现已完全在 Fireworks 上可训练,支持 SFT、DPO、RL 等训练方式。用户可以使用自己的数据微调模型,构建比前沿模型成本更低的护城河。Fireworks 提供托管点击或原始 API,支持大上下文和巨大 LoRA 秩。

推荐理由:Fireworks 让你拿 Kimi 2.7 自己训练,便宜还能干翻前沿模型,想定制模型的赶紧试试。
02:58