背景与动机
随着深度学习网络的预训练-微调范式的流行,如何高效地使预训练模型适配到下游任务一直是一个广泛关注的问题。随着预训练大语言模型的规模越来越大,完整微调整个网络的开销十分昂贵,因此研究人员提出了低成本的参数高效微调方法。对于使用低参数模块来适配完整预训练大模型这一问题,现有的方法均通过启发式的方式来构造可训练的模块,其中的基本原理仍然不清楚。在本论文中,我们从机器学习理论 PAC-Bayesian 泛化误差上界的角度,探讨了预训练模型和随机初始化模型之间的差异,将其性能表现上的不同归因于先验分布之间的差异,并从损失景观的不同和近似稀疏的梯度分布两个角度验证了这种差异。由于这种差异的存在,我们表明预训练模型在微调过程中达到较优解所需的搜索空间的维度被压缩,因此通过微调很少一部分参数即可有效适配下游任务。基于此,我们提出了一种基于梯度的分量稀疏微调算法,称为稀疏增量微调 (Sparse Increment Fine-Tuning,SIFT),并在一系列任务上验证了有效性,和参数利用效率上的优势。
论文链接:https://arxiv.org/abs/2312.11875
方法
一、预训练模型的PAC-Bayesian泛化误差上界本文回顾了PAC-Bayesian泛化误差分析的一个经典上界,该上界表明当模型的先验分布更接近后验分布时,模型的泛化误差将会被一个更紧的上界控制。直观上,相较于从零训练,经过预训练的语言模型的参数分布更加接近下游任务的参数分布,从而保障了预训练模型良好的泛化性能。我们从损失景观和梯度两个角度考察了这种分布上的差异。如图1,损失景观的一维和二维可视化表明,相较于预训练模型周围损失的剧烈震荡,随机初始化模型的周围的损失震荡相对平缓。通过多元泰勒展开的一阶近似分析,这种震荡的差异来源于不同维度的梯度分布上的差异,对随机初始化模型而言,各维度的梯度分布相对均衡,损失的变化趋近于梯度分布的期望,从而避免了剧烈的震荡,而对预训练模型而言,部分维度上存在不一致的梯度分布,因而损失会被这些维度显著影响,出现剧烈震荡。
图 1 损失景观可视化
我们对梯度分布的可视化验证了上述的分析,图2表明从零训练的模型梯度分布呈现出均值为0的正态分布,而预训练模型则表现出一种极端的类似稀疏的梯度分布,即少部分分量占据了梯度范数的绝大部分,例如1%的分量占据梯度的超过99%。
图 2 梯度分布
以上现象反映出预训练模型在微调过程中维度的冗余,在下游任务中无需在完整的参数空间上搜索即可找到一个较优解,也即有着较低的内在维度,另一个角度,由于梯度的近似稀疏性,更新梯度较大的分量即可使经验损失迅速下降,由于预训练模型更紧的泛化误差上界,随着经验损失的下降,泛化损失也能够一致降低。基于此我们提出了一种高效的分量稀疏微调的实现方式,并验证了分量稀疏微调的可行性。
二、稀疏增量微调本文提出了一种分量稀疏微调的实现方法(Sparse Increment Fine-Tuning, SIFT),通过在反向传播过程中插入hook function实现显存高效,图3展现了算法的整体流程。
图3 SIFT步骤具体步骤如下:1. 我们为需要进行稀疏更新的参数分别注册变量SG和SP,用于存储稀疏梯度和稀疏参数增量,稀疏变量以索引和值的方式存储,其中索引反映了梯度较大分量的位置。2,3. 反向传播过程中,当某梯度计算完成后,通过索引的方式获取指定分量上的梯度并存储到变量SG中,清除完整的梯度以避免占用额外的显存。4. 通过优化器,使用稀疏梯度计算稀疏增量。5. 将稀疏增量添加到预训练参数中,完成一批数据的更新。
评价和结果
本文在自然语言理解任务GLUE benchmark和大语言模型指令微调任务上对比了主流参数高效方法和SIFT的性能,实验结果表1、表2 验证了通过分量稀疏的方式实现参数高效的可行性。图4表明在低参数量下,SIFT这种基于梯度的分量稀疏微调有着更好的表现,在参数的利用效率上更优。更多数据细节可见原文。
表1 GLUE benchmark
表2 指令微调
图4 参数利用效率分析
技术贡献
本研究的贡献包括:(1)本文从 PAC-Bayesian 泛化误差上界的角度探讨了预训练模型的泛化性能,并通过分析损失景观和梯度分布的变化来验证预训练模型先验分布的偏移。(2)将预训练模型的低内在维度归因于预训练过程导致的分布偏移,因此在下游任务上无需在全空间搜索最优解,在较高梯度值的维度所张成的子空间中即可搜寻到一个较优解。(3)基于预训练模型梯度的近似稀疏性,我们提出了一种显存高效的分量稀疏实现方案,并在一系列实验上验证其有效性和参数利用的高效性。
作者介绍
李祖超,武汉大学计算机学院副研究员,“武汉英才”计划获得者,曾在日本国立情报研究机构(NICT)访问,于2021年入选了全球AI华人百强学术新星。研究方向为自然语言处理、预训练模型、人工智能算法。近年来主持国家、省部级等各类项目多项,在TPAMI, ICLR, ACL, AAAI等期刊和会议上发表论文50余篇,Google Scholar被引1800余次。指导本科生硕士生多次在IJCAI、ACL、AAAI等国际会议上发表一作论文,有丰富的本硕博学生指导经验(个人主页:https://zcli-charlie.github.io/)。