Pretraining

general · 首次出现 2026-05-22 · 最近出现 2026-09-26 · 累计提及 77

综述

Pretraining(预训练)是指人工智能模型在特定任务开始前使用大量未标记数据进行初步训练的过程,目的是让模型学习通用的表示和知识。根据近期研究,预训练对大型语言模型和多模态模型的成功至关重要,但如何优化预训练过程仍存在诸多挑战。

Pretraining 近期进展

2026年8月,研究人员在arXiv上发表论文指出,有效的学习率控制着语言模型预训练中的损失动态,这一发现对提高预训练效率具有重要意义。Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining

TokEval作为新的分词器评估套件于2026年8月发布,旨在帮助研究人员更好地评估不同分词策略在预训练过程中的效果。TokEval: 分词器评估套件

NVIDIA使用Streaming、Pandas和tiktoken技术构建了Nemotron代码数据集管道,为代码预训练提供了新的数据处理方法。用 Streaming、Pandas 和 tiktoken 构建 NVIDIA Nemotron 代码数据集管道

OpenAI的研究表明,视频预训练可以让AI以少量标注数据掌握Minecraft游戏,展示了预训练在减少标注需求方面的潜力。视频预训练教AI玩转Minecraft,仅需少量标注数据

当前焦点与观察点

预训练安全措施已成为研究热点,OpenAI在DALL·E 2预训练中实施了多项安全缓解策略,反映了行业对预训练模型潜在风险的重视。DALL·E 2预训练安全措施

多模态预训练的物理机制,包括知识流、模态协同与早期统一等概念,正在成为理解预训练过程的关键视角。多模态预训练的物理:知识流、模态协同与早期统一

相关报道

7 条在档