Meta联合华盛顿大学验证字节级蒸馏提升模型上限
Meta FAIR与华盛顿大学在论文《突破Token天花板:蒸馏出更小、更强的字节模型》中提出,知识蒸馏不必局限于Token。研究团队为每个Token加入结束标记,并将教师模型的Token概率分布完整映射到字节级别,让学生模型直接学习字节概率。
以Llama 3-8B为教师的实验和缩放定律预测显示,随着训练计算量增加,字节级蒸馏有望超过Token级蒸馏,下游任务平均准确率上限最高可提升4个百分点。
传统蒸馏需要处理Llama 3-8B约128256个Token的候选分布,离线保存时通常只能保留top-k概率。字节模型每个位置仅有256种基础取值,更容易保存完整分布。团队提出Marginalize-It和End-Of-Token两种转换方法:前者按真实字节前缀聚合候选概率,并对已结束Token后的剩余概率重新归一化;后者在Token末尾加入特殊结束符,从而保留不同长度Token的边界信息。两种方法均只需教师模型进行一次前向计算。
研究共比较Token、普通字节和带结束符字节三种表示,并分别进行监督训练与蒸馏训练。教师统一为Llama 3-8B,学生Transformer层参数均约12.8亿,计入词表后Token学生约18.1亿参数,字节学生仍约12.8亿。模型使用约万亿字节规模数据,在选择题问答、语言生成和机器翻译三类任务的八项评测中进行测试。Token模型早期收敛更快,字节模型则在扩大计算量后持续提升。
根据“计算量—BPB—下游成绩”关系外推,Token蒸馏、Marginalize-It蒸馏和End-Of-Token蒸馏的平均准确率上限分别为48.4%、50.5%和52.4%。普通字节监督训练的预测上限为51.2%,高于Marginalize-It,但End-Of-Token超过了其他方案;其在约6.33×10²² FLOPs时即可追平Token蒸馏的预测上限。研究同时指出,BPB更低不代表下游答题成绩必然更高。
在相同预测计算预算下,End-Of-Token处理的实际文本量约为Token方案的六分之一;若Token方案仅保存top-600、字节方案保存完整分布,存储量约为其五分之一。不过,加入结束符会使相同文本量的训练计算量较普通字节模型增加约30.94%,论文尚未完成等推理成本下的公平比较。论文作者来自Meta FAIR与华盛顿大学,团队成员包括Llama 3预训练负责人Mike Lewis及BLT、QLoRA相关作者Artidoro Pagnoni等。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文