资讯动态

Meta的研究揭示字节模型蒸馏的新潜力

2026-09-15
1749次

近年来,对于大型模型蒸馏的研究不断深入,Meta FAIR与华盛顿大学的研究提出了一种新方法,将学习单位从常用的词元转换为字节。这一创新思路在论文《突破Token天花板:蒸馏出更小、更强的字节模型》中得以详细阐述。研究表明,通过在蒸馏过程中使用字节作为基础单位,可以显著提升模型的性能。

研究团队在实验中给每个Token添加了结束标记,并成功将教师模型的Token概率分布转化为字节级别的分布。在以Llama 3-8B作为教师模型的实验中,结果显示,字节级蒸馏在随着训练计算量增加后,准确率上限比Token级蒸馏高出4个百分点。这是因为相比于拥有巨大Token词表的传统方法,字节模型只有256种基本取值,使得每个位置的预测空间更小,从而减少了存储的复杂性。

蒸馏技术已经被广泛应用于小模型学习大模型的优点。与传统的监督训练相比,蒸馏不仅让学生模型预测下一个Token,还让其学习教师模型对每个候选Token的概率。然而,Token的候选空间极为庞大,比如Llama 3-8B有128256个Token,每个预测位置对应的概率种类也相应增加,存储需求高. 球友会

字节模型则压缩了这一空间,每个字节仅需保存约256个取值,使得完整分布的保存成为可能。为了解决教师与学生模型之间的匹配问题,研究团队提出了两种方案:Marginalize-It与End-Of-Token。Marginalize-It方法通过将教师对不同Token的概率逐步分解到字节上,虽然在处理不同长度的Token时可能会丢失一些信息。相较之下,End-Of-Token方法则在每个Token的末尾加入一个特殊符号,使得字节模型能够更完整地映射教师分布。

about image

研究最终通过多组实验对这三种表示方法进行了比较,检验了蒸馏与改变学习单位后模型的表现。结果表明,字节模型蒸馏提供了新的可能性,令模型能够更有效地学习和提升性能。

全国咨询热线

13594780347

球友会.(中国)官方网站

联系电话:13594780347

联系人:李总

邮箱:liturgical@outlook.com

公司地址:南平市丰欺入口477号


微信扫一扫

手机官网