10:13官方账号arXiv cs.LG@Jingtan Wang, Arun Verma, Xiaoqiang Lin, Zhengyuan Liu, Nancy F. Chen, Daniela Rus, Bryan Kian Hsiang Low精选73°研究解决了大模型后训练中监督微调(SFT)与强化学习(RL)的标注预算分配问题。该研究提出了近最优区域概念,即使在2-10%的小容忍度下,该区域也很宽。研究发现近最优区域随模型规模扩大而变宽,并能从小代理模型可靠转移到大型目标模型。研究结果在不同任务、模型家族和基于偏好的离策略与基于奖励监督的在策略RL方法中保持一致。论文SFTRL大模型推荐理由:研究人员发现小模型实验就能确定可转移的近最优区域,无需大规模搜索,大幅降低大模型训练成本。原文稍后读已读值得跟进有用关注 SFT
09:33官方一手arXiv: DeepSeek@Mustafa Yasir Altunhan, Hüseyin Özgür Kamalı, Eray Tüzün精选73°研究通过微调GPT-4o和多个开源模型(CodeLlama-7B、CodeQwen1.5-7B等)来分类PR与问题的对应关系。微调后的模型准确率和F1-micro提升了6.15%,F1-macro提升了14.69%。CodeLlama-7B表现最佳,代码差异与问题内容对预测影响最大。论文CodeLlama-7BGPT-4o微调推荐理由:研究人员微调了多个大模型来自动匹配PR和问题,准确率提升显著,还能解释模型决策依据。原文稍后读已读值得跟进有用关注 CodeLlama-7B
08:43shao__meng@shao__meng73°Shopify ML团队基于Qwen3.5-0.8B微调的模型在特定任务上击败了GPT 5.6-sol xhigh。CEO tobi表示,为特定用途训练小模型效果出奇地好。这一成功依赖于优秀的自我改进递归飞轮机制。小模型在专门任务上展现出超越大模型的性能。AI模型Qwen3.5-0.8BGPT 5.6-sol xhighShopify推荐理由:Shopify用0.8B小模型微调后打败了GPT 5.6-sol xhigh,小模型专用训练有奇效。原文稍后读已读值得跟进有用关注 Qwen3.5-0.8B
01:03Fireworks AI@FireworksAI_HQ精选Fireworks公司使用开放模型进行微调,训练出医疗AI助手ambient scribe。该助手生成的临床病历在医生盲测中优于Gemini模型,延迟降低3.5倍。医生对生成的病历有足够信任度,可直接签字确认。Fireworks提供训练平台让用户构建自己的前沿模型。AI产品Fireworksambient scribeGemini推荐理由:Fireworks的医疗AI助手病历生成速度比Gemini快3.5倍,医生可直接签字使用,适合医疗从业者关注。原文稍后读已读值得跟进有用关注 Fireworks
00:34elvis@omarsar0精选73°Shopify ML团队训练的0.8B模型在特定任务上击败了GPT-5.6-sol xhigh。小型专用模型在特殊场景下表现出色。拥有自己的智能堆栈对未来公司保持竞争力至关重要。Tobi Lutke强调了小型模型在特定用例中的有效性。AI模型ShopifyGPT-5.60.8B模型推荐理由:Shopify用0.8B模型干翻GPT-5.6,小模型专用场景真香原文稍后读已读值得跟进有用关注 Shopify
12:20官方一手arXiv: DeepSeek@Mohammadsina Hassannia, Matthew A. Reyna, Reza Sameni精选研究人员开发了ECGQuest,一个包含10,904个唯一真/假问题的数据集,源自23篇心电图参考文献和2003-2025年Computing in Cardiology会议。该基准测试了3个商业和20个开源语言模型,零样本准确率在49.5%至74.4%之间,GPT-5表现最佳。微调使5个开源模型(7-14B参数)的准确率提升6.5-14.1%,其中DeepSeek-R1-Distill-Qwen-14B达到76.3%。论文ECGQuestGPT-5DeepSeek-R1-Distill-Qwen-14B推荐理由:ECGQuest为心电图领域语言模型提供了首个专业评测基准,微调让小模型接近大模型表现。原文稍后读已读值得跟进有用关注 ECGQuest
20:02官方账号arXiv cs.AI@Pranav Aggarwal精选73°研究显示,当LLM智能体面对专业外观的市场面板时,对不可预测问题的承诺率从6.5%跃升至54.0%。即使面板上的所有数字都是虚构的,承诺率仍从24.5%上升到36.8%,与真实数据产生的37.6%无显著差异。同一模型在可回答问题上准确率接近完美,表明问题不在于能力或信念,而在于行动决策机制。论文LLM Agents智能体AI安全推荐理由:Calibrated Enough论文揭示LLM智能体如何被虚假证据误导,以及如何通过微调修复这一缺陷。原文稍后读已读值得跟进有用关注 LLM Agents
09:21官方一手arXiv: DeepSeek@Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun Li, Yue Liao, Heng Chang, Xiaobin Hu, Qibing Ren, Wangchunshu Zhou, Shuicheng Yan精选JIT-Agent模型旨在即时合成适用于任意现成LLM的任务自适应智能体绑定,通过固定四模块协议生成可组合的智能体绑定,并在给定任务上定制绑定、修复绑定以实现稳定可靠执行,并通过从先前绑定配置的扩展档案中提炼性能信号来自我进化。DeepSeek-V4-Flash在DeepSearchQA和OdysseyBench上超越GPT-5.6,GLM-5.2提升至+20.2分。JIT-Agent生成的绑定在性能上与成熟的智能体运行时如OpenCode和Claude Code相当,并持续改善DeepSeek V4、Mimo-V2.5和Qwen3.6的多尺度模型家族。JIT-Agent是首个专为即时绑定生成而设计的模型,将绑定智能确立为与模型扩展正交的可训练、可转移和可累积的智能体能力维度。AI模型JIT-Agent智能体MCP/工具4 个信源在谈事件专题推荐理由:JIT-Agent模型可以即时合成适用于任意现成LLM的任务自适应智能体绑定,显著提升模型性能,值得一试。原文稍后读已读值得跟进有用关注 JIT-Agent
11:05Notion@NotionHQNotion近期对内部代理进行了多项改进,使代理的可靠性得到显著提升。停滞运行降至0.17%,意外错误降至0.34%,现在99.91%的响应都能成功完成。这些改进背后是大量的工程工作,旨在让代理在日常使用中更加可靠。改进工作仍在继续。AI产品Notion智能体MCP/工具1 个信源在谈事件专题推荐理由:Notion的代理功能经过升级,运行更稳定,错误率更低,是日常工作中值得信赖的助手。原文稍后读已读值得跟进有用关注 Notion
09:48elvis@omarsar0精选A paper discusses the impact of harnesses on agent benchmark scores, revealing significant variance caused by harness configurations. The study compares three frontier models across 100 tasks, showing harness-induced variance is 7.8x larger than model-induced variance. The authors propose a Harness Card for structured disclosure. Paper available at arxiv.org/abs/2605.23950.论文AI安全智能体多模态推荐理由:This paper reveals the hidden influence of harnesses on AI model scores, offering a new perspective on leaderboard comparisons. It's a must-read for those interested in understanding the true performance of AI models.原文稍后读已读值得跟进有用关注 AI安全
07:48Latent.Space@latentspacepodOpenAI、Anthropic、Google 和 Microsoft 近几个月承诺投资超过 90 亿美元将 AI 应用于企业。我们与 Decagon、Vapi、Retell、Smallest AI 和 Daily 合作,探讨构建企业语音智能体的实际挑战,包括为什么使用 STT-LLM-TTS 流程而非语音到语音模型,如何平衡智能与延迟,以及为什么轮流说话问题尚未解决。行业智能体MCP/工具AI安全10 个信源在谈事件专题推荐理由:看看 Latent Space Pod 与 Basil Chatha 合作推出的新 Forward Deployed Engineering pod,了解企业级语音智能体构建的实际挑战和解决方案!原文稍后读已读值得跟进有用关注 智能体
01:08eric zakariasson@ericzakariasson精选Grok Bot 提供延长运行时间的技巧,包括使用事件触发、及时通知、使用连接器、保持技能紧凑、避免在聊天中编码、删除不再需要的单次监视器等。技巧Grok Bot提示词工程编程助手推荐理由:想要提高 Grok Bot 的效率?这篇推文分享了延长其运行时间的实用技巧,值得一试!原文稍后读已读值得跟进有用关注 Grok Bot
16:14量子位@十三SenseNova U1.5 Lite开源,8B参数,在ImageNet基准上表现与闭源Image 2相当。模型开源,支持PyTorch和TensorFlow。AI模型SenseNova U1.5 Lite开源模型推理模型推荐理由:SenseNova U1.5 Lite开源了,参数量8B,和闭源Image 2一样强,用PyTorch和TensorFlow都能跑,值得一试!原文稍后读已读值得跟进有用关注 SenseNova U1.5 Lite
10:15官方一手arXiv: OpenAI@David WajcThis note closes the asymptotic gap for fractional online matching under edge arrivals, proving an optimal competitive ratio of $1/2+Θ(1/n)$. OpenAI's ChatGPT Sol suggested and analyzed the algorithm based on a single prompt, with the presentation refined over a few hours of discussion with the author.论文智能体推理模型微调10 个信源在谈事件专题推荐理由:OpenAI的ChatGPT Sol仅用一个提示就提出了这个算法,展示了其强大的能力,值得一试。原文稍后读已读值得跟进有用关注 智能体
22:33Philipp Schmid@_philschmidMCP团队公布了未来6-12个月的公开路线图,包括支持长运行任务、使用HTTP协议、渐进式目录发现、标准身份和权限等更新。AI模型MCP智能体MCP/工具推荐理由:MCP团队发布了未来计划,包括多项重要更新,值得关注。原文稍后读已读值得跟进有用关注 MCP
01:03Jerry Liu@jerryjliu0精选当前智能体(Codex、Cowork)采用两步文档处理方法:快速解析和即时VLM处理,提高知识工作准确性。Opus 5作为第二遍处理工具,但成本高。Llama_index提供更优解决方案:LiteParse和LlamaParse,支持多种文档类型和子文档处理。技巧智能体文档处理Llama_index推荐理由:Llama_index提供更优文档处理工具,提升智能体知识工作准确性,降低成本。原文稍后读已读值得跟进有用关注 智能体
16:18宝玉@dotey精选Gergely Orosz 提出简化AI服务接入方式,建议服务或App提供MCP或cli接口,直接访问用户常用的Agent,无需额外内置Agent。适用于非前沿AI实验室用户。技巧智能体MCP/工具提示词工程推荐理由:Gergely Orosz 提出了一种更便捷的AI服务接入方式,无需额外内置Agent,直接访问用户常用的Agent,让AI服务更易用。原文稍后读已读值得跟进有用关注 智能体
03:53techcrunch@Julie BortNvidia研究显示,即使AI模型在任务上表现不佳,通过微调,AI智能体仍能良好表现,不会失控。AI模型NvidiaAI智能体微调3 个信源在谈事件专题推荐理由:Nvidia展示了AI模型之外的另一个关键因素——harness,它对AI性能至关重要。原文稍后读已读值得跟进有用关注 Nvidia
17:08官方账号阿里通义 Qwen@Alibaba_Qwen精选NVFP4 + DFlash2 食谱加入 Qwen3.8-27B 烹饪书。社区已见证显著效果,为探索提供起点。更多更新即将到来。AI模型Qwen3.8-27BNVFP4DFlash23 个信源在谈事件专题推荐理由:Qwen3.8-27B 新食谱发布,NVFP4 + DFlash2 融入,探索新起点!原文稍后读已读值得跟进有用关注 Qwen3.8-27B
06:58IT之家(博客/媒体)精选蚂蚁百灵开源了 Ling-3.0-tiny-base 和 Ling-3.0-flash-base 模型。官方开放了预训练、中期训练和 WSM 合并等 6 个关键训练节点权重。Ling-3.0-tiny-base 模型总参数 7.9B,在代码能力上表现优异。Ling-3.0-flash-base 模型总参数 124B,适合研究者和开发团队继续训练。这些 Base 模型并非聊天模型,不建议直接部署为面向终端用户的服务。AI模型Ling-3.0蚂蚁百灵开源模型推荐理由:蚂蚁百灵把 Ling-3.0-tiny 和 flash 的 Base 模型开源了,还把训练过程中的 6 个关键节点权重都放出来了。tiny 模型参数少但代码能力强,flash 模型参数多适合继续训练,对研究者挺有用。原文稍后读已读值得跟进有用关注 Ling-3.0
04:38AI Engineer@aiDotEngineer72°一个夜间报告智能体连续运行数周后,将经理的私人团队分析作为PR提交到代码库。一位CTO通过智能体将每周2到10个PR的产出提升至每晚。一个微调分类器带来1200万美元收入,但修复成本高昂,现被前沿模型技能取代,修复时间缩短至一小时以内。智能体每晚打开数百个GitHub问题,请求研究人员发布模型权重,数千个问题后仅收到两次投诉。技巧智能体GitHub提示词工程推荐理由:看看这些工程师怎么教AI干活:智能体自动提交PR、训练模型、修复代码,甚至催更模型权重,效率提升肉眼可见。原文稍后读已读值得跟进有用关注 智能体
02:05Philipp Schmid@_philschmid精选Awesome Gemma 资源库已在 GitHub 上线。该库收录了 16 个 Gemma 模型变体的模型卡片和合集。它还提供了 Ollama、vLLM 和 LiteRT 的设置指南。此外,库中包含 Unsloth、Tunix 和 MLX 的微调教程。社区项目、应用和演示也包含在内。AI产品GemmaGoogleOllama推荐理由:Google 的 Awesome Gemma 资源库上线了,里面有你想要的模型卡片、部署指南和微调教程,比自己找方便多了。原文稍后读已读值得跟进有用关注 Gemma
01:06elvis@omarsar0Harvey发布了其首个法律专用模型Tenet。该模型基于Kimi K3,在法律数据集上进行了微调。Tenet在LAB Contracts基准上达到SOTA性能,在LAB基准上排名第二。其所有通过率比Kimi K3基座模型提升了82%。该模型还针对代币效率进行了优化,成本仅为领先基础模型的四分之一。AI模型HarveyTenetKimi K38 个信源在谈事件专题推荐理由:Harvey发布了法律专用模型Tenet,在法律任务上表现优异,成本还很低,展示了AI原生公司如何构建自己的智能栈。原文稍后读已读值得跟进有用关注 Harvey
23:04官方一手marktechpost@Sana Hassan精选本文提供使用直接偏好优化(DPO)微调语言模型的端到端工作流。教程演示了如何审计 Anthropic HH-RLHF 数据集的结构和长度偏差。它展示了如何使用 TRL 和 LoRA 实现一个稳健的训练管道。最后,文章评估了模型性能,以确保其进行真实的偏好学习,而非依赖词汇捷径。技巧DPOTRLLoRA2 个信源在谈事件专题推荐理由:这篇教程教你用 DPO、TRL 和 LoRA 来微调模型,还教你怎么检查数据里的偏见,比直接用 RLHF 更简单。原文稍后读已读值得跟进有用关注 DPO
03:38Fireworks AI@FireworksAI_HQ精选Fireworks 的 Dedicated Training API 现已支持 Muse Glimmer 30B 模型。开发者可以使用 LoRA 或全参数微调方式对该模型进行定制。这款美国开发的开放权重模型擅长智能体任务和长程推理。AI产品Muse Glimmer 30BFireworks微调推荐理由:Fireworks 现在能微调 Muse Glimmer 30B 了,适合做智能体和长推理任务。原文稍后读已读值得跟进有用关注 Muse Glimmer 30B
10:35官方账号arXiv cs.LG@Ben Anson, Conor Houghton, Edward MilsomMuon 优化器在神经网络预训练中优于常见替代方法,但在 PEFT(参数高效微调)中很少使用。原因在于 LoRA 的低秩参数化无法直接对权重更新做正交化。作者提出 sMuon,通过线性化和最小二乘近似松弛的 Muon 目标,且实现只用 matmul 运算。在 SFT 和 ReLoRA 预训练实验中,sMuon 相比基线有适度性能提升。论文MuonLoRAsMuon推荐理由:Muon 优化器跟 LoRA 本来不搭,这篇论文用数学近似硬凑出了个 sMuon,微调性能有提升,实现还只用矩阵乘法。原文稍后读已读值得跟进有用关注 Muon
19:32官方一手marktechpost@Sana Hassan精选教程展示了基于XYZ-Aquila-SFT和Qwen3搭建工具调用模型微调流程。内容涵盖轨迹解析、结构化工具调用提取以及Qwen兼容的ChatML渲染。最后使用PyTorch实现LoRA高效参数适配。技巧XYZ-Aquila-SFTQwen3微调推荐理由:想自己做工具调用模型?这篇手把手教你用XYZ-Aquila-SFT和Qwen3微调,从数据到LoRA都有。原文稍后读已读值得跟进有用关注 XYZ-Aquila-SFT
11:15官方一手marktechpost@Sana Hassan精选本教程演示了从Hugging Face流式获取SupraLabs推理语料库,并完成质量过滤与数据策展。以SmolLM2-135M-Instruct为基座、LoRA为微调方法,进行监督微调(SFT)并跑通端到端流程。该方案在135M参数规模下验证,无需过多GPU资源即可打造专用推理模型。技巧SupraLabsSmolLM2LoRA推荐理由:教程用SupraLabs语料库+SmolLM2+LoRA,教你在小显卡上微调出推理模型,比追大模型省资源。原文稍后读已读值得跟进有用关注 SupraLabs
18:15官方账号NVIDIA AI@NVIDIAAI72°AgileRL 宣布与 NVIDIA 合作,支持 Nemotron 系列模型的后训练。NVIDIA 提前提供了 30B3A 参数 MoE 模型 Nemotron 3.5 Lightning。在 Arena 平台上,该模型经微调后在长程推理和真实客服任务上超过 Claude Sonnet 5。单次训练只需四块 H100 GPU 运行六小时即可掌握推理任务,上下文长度超过 50,000 token。Arena 客户可在 Nemotron 模型发布后立即获得相应的训练与评估环境。AI模型NemotronNVIDIAAgileRL10 个信源在谈事件专题推荐理由:AgileRL 把 Nemotron 3.5 Lightning 放到 Arena 上微调,6 小时就能超过 Claude Sonnet 5,训练完权重还归你。原文稍后读已读值得跟进有用关注 Nemotron
18:04官方账号NVIDIA AI@NVIDIAAI精选Reasonable 团队用 4B token 的合成 Verus 数据微调了 NVIDIA 最新开源模型 Nemotron 3.5 Lightning(30B)。微调后的模型在单次尝试通过率上超越了一个规模约 50 倍于它的模型,pass@3 则几乎持平。它的 token 生成速度也快于测试过的所有同尺寸开源模型。配套博客还分析了各模型在形式化证明中的失败方式、作弊行为,以及微调带来的影响。AI模型NemotronNVIDIAVerus10 个信源在谈事件专题推荐理由:Reasonable微调了NVIDIA的30B开源模型,形式化证明通过率胜过50倍大的模型,生成还更快。博客还拆解了模型怎么作弊。原文稍后读已读值得跟进有用关注 Nemotron
18:04官方账号NVIDIA AI@NVIDIAAIFastino Labs与NVIDIA合作发布两款开源模型Fastino-Nemotron-3.5-Lightning-Finance和Fastino-Nemotron-3.5-Lightning-Healthcare,均基于Nemotron 3.5 Lightning微调。金融模型在FinQA基准上执行准确率从15.86%提升至59.23%,增幅43.37个百分点;在BizFinBench上从49.65%升至57.46%。医疗模型在HealthAdminBench上从25.67%升至29.95%,在MedCalc-Bench上从49.09%升至54.18%。两款模型均以Apache 2.0许可发布在Hugging Face上。同时,Fastino还发布了自动微调工具Fastino Fine-Tuning Agent的私人预览版。AI模型FastinoNVIDIANemotron 3.510 个信源在谈事件专题推荐理由:Fastino跟NVIDIA合作,用自动微调Agent搞出了金融和医疗两个开源模型,FinQA涨了43个点,Apache 2.0随便用。原文稍后读已读值得跟进有用关注 Fastino
17:54官方账号Cohere@cohere精选Cohere 宣布其视觉模型 North Micro Vision 已集成至开源微调框架 Axolotl。用户无需自备 GPU 或服务器,即可直接开始训练该模型。Axolotl 官方文档已提供 Cohere 模型的配置说明,地址为 docs.axolotl.ai。这降低了视觉模型微调的门槛。AI模型North Micro VisionAxolotlCohere推荐理由:想微调 Cohere 的视觉模型 North Micro Vision?现在用 Axolotl 就能跑,不用自己买显卡,直接上手试试吧。原文稍后读已读值得跟进有用关注 North Micro Vision
17:48官方账号NVIDIA AI@NVIDIAAICodeRabbit与Baseten合作,用CodeRabbit自身的路由决策数据微调了NVIDIA Nemotron 3.5 Lightning。整个微调过程耗时不到3小时,花费低于100美元。微调后的模型相比此前的GPT级模型,准确率提升约4%,推理成本下降约50%。详细技术解析已发布在CodeRabbit官方博客。AI模型CodeRabbitNemotron 3.5 LightningBaseten10 个信源在谈事件专题推荐理由:CodeRabbit用不到100美元和三小时微调了NVIDIA新模型,比原来的GPT级模型准确率高4%,推理成本还省一半,想省钱的可以看看。原文稍后读已读值得跟进有用关注 CodeRabbit
07:20官方账号NVIDIA AI@NVIDIAAI精选NVIDIA 发布全新 MoE 模型 Nemotron 3.5 Lightning。distil labs 作为欧洲发布合作伙伴,对其进行了微调。该团队将微调版与 4 个可比 MoE 模型在 6 项任务上对比,未微调时排名第三,微调后跃居第一。完整数值与失败场景已公布在 distil labs 博客上。AI模型Nemotron 3.5 LightningNVIDIAdistil labs10 个信源在谈事件专题推荐理由:NVIDIA 的 Nemotron 3.5 Lightning 微调后,在 6 项任务上超过 4 个同类 MoE 模型拿了第一。想知道怎么调出来的,可以看这篇。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
03:57官方一手marktechpost@Sana Hassan精选AllenAI 的 Open Instruct 框架支持在 16GB 显存上完成 LLM 后训练全流程。教程覆盖 SFT、DPO、RLVR 和 GRPO 四种主流方法。验证器(verifier)被用于评估模型输出质量。无需分布式计算基础设施,单卡即可运行。技巧Open InstructTulu 3AllenAI推荐理由:想自己微调模型又没大显卡?这份教程教你在 16GB 显存上跑完 SFT、DPO、GRPO 全流程,用的还是 AllenAI 的开源框架。原文稍后读已读值得跟进有用关注 Open Instruct
18:39官方一手arXiv: DeepSeek@Liang Zhang, Stephen Hwang, Yue Ma, Jinfa Cai一项研究测试了LoRA监督微调能否提升LLM在数学隐喻编码任务上的表现。研究者使用2,265条6-8年级学生回答,让模型完成效价强度编码和主题编码。对比了GPT-4o mini、GPT-5 mini与DeepSeek-R1 1.5B、Mistral 7B,微调后开源模型性能大幅提升,且与专有模型竞争甚至超越。结果表明紧凑开源模型可支持可扩展、隐私友好的教育测量。论文LoRA微调DeepSeek-R1推荐理由:想知道小模型微调后能不能干过大厂API?这篇用2千多条真实学生数据实测,DeepSeek-R1 1.5B微调后比GPT-5 mini还稳。原文稍后读已读值得跟进有用关注 LoRA
11:04官方账号arXiv cs.LG@Xinyi Xu, Bingnan Xiao, Shuang Qin, Gang Feng, Tony Q. S. Quek联邦学习中的LoRA微调通常将更新矩阵分解为A和B两个因子。本文通过最小二乘代理模型分析发现,共享A保留本地B(Share-A/Local-B)要求客户端更新矩阵共享输入侧秩r空间,而共享B保留本地A(Share-B/Local-A)则要求共享输出侧秩r空间,两种策略投影残差不同。据此提出FedAS-LoRA,在训练前用Rank-Aware Shared-Subspace Sufficiency(RSS)指标评估共享子空间充分性,自动选择共享侧。实验覆盖不同任务、数据分布、LoRA秩和参与率设置,验证了RSS有效性和FedAS-LoRA的优越性能。论文LoRA联邦学习FedAS-LoRA推荐理由:联邦学习调LoRA的朋友看这篇,它告诉你A和B该共享哪个,还给了个训练前就能算的指标,省得瞎试。原文稍后读已读值得跟进有用关注 LoRA
05:29Fireworks AI@FireworksAI_HQFireworks推出Training Skill,可在Claude Code、Codex或Cursor中安装。用户只需一行命令安装,然后描述训练目标。该技能会自动选择微调方法、验证数据并估算成本。它还能启动Fireworks训练任务并排查故障。AI产品FireworksTraining SkillClaude Code6 个信源在谈事件专题推荐理由:Fireworks出了Training Skill,装一行让Claude Code帮你跑微调,选方法、验数据、估成本都包了。原文稍后读已读值得跟进有用关注 Fireworks
10:41官方账号arXiv cs.LG@Fardin Afdideh, Fernando Seoane, Farhad Abtahi一项新综述系统梳理了大模型后训练适配技术,提出按机制、目标、数据需求、持久性、结构范围、模型类型六个维度分类。该分类法区分了微调、检索增强、提示等常被混用的概念,并梳理了技术间的继承、取代、混合与分层关系。研究者认为这套统一词汇可用于技术文档、模型变更追踪和AI治理分析。论文还指出评估、可复现性、遗忘、多模态适配等开放挑战。论文微调RAGAI治理推荐理由:Arxiv上这篇综述把微调、RAG、对齐这些概念理清了,还给了六个维度的分类框架,做AI治理和模型管理的人可以拿来当参考。原文稍后读已读值得跟进有用关注 微调
05:09Fireworks AI@FireworksAI_HQFireworks 宣布 DeepSeek V4 Flash 0731 开放微调。用户可通过 Dedicated Training API 运行 SFT、DPO 和 RL 训练任务。SFT 与 DPO 也能在托管界面中操作。该模型面向编码智能体和高吞吐生产场景,官方称以远低于同类方案的成本提供强质量。AI模型DeepSeekFireworks微调推荐理由:DeepSeek V4 Flash 0731在Fireworks微调,支持SFT/DPO/RL,成本低原文稍后读已读值得跟进有用关注 DeepSeek