09:18官方一手arXiv: DeepSeek@Jia Peng Lim, Hai Leong ChieuDeepSeek的Engram条件记忆模块在存储与推理之间做权衡,但依赖token级N-gram哈希,导致不同tokenizer需从头训练。论文提出用多项式哈希替换XOR哈希,建立跨N的联合嵌入空间。实验显示该改动在保持性能的同时实现tokenizer无关性,字节等价序列哈希相等。论文DeepseekEngramTokenizer推荐理由:DeepSeek改了Engram的哈希方式,不同tokenizer之间不用再各自训练,效果还一样,做多语言模型的可以看看。原文稍后读已读值得跟进有用关注 Deepseek
09:50向阳乔木@vista8Tokenizer是AI模型处理文本的前置步骤,将句子切成子词单元。主流模型如GPT-4使用BPE算法,单词'hello'可能被分成'hel'和'lo'两个token。这解释了为什么大模型在要求数'strawberry'中的r时会数错。本教程通过实例演示,帮助理解tokenizer机制。技巧TokenizerBPE分词推荐理由:想搞懂大模型数不对数的原因?这个视频讲得特别清楚,几分钟就懂了。原文稍后读已读值得跟进有用关注 Tokenizer