产学研创新服务平台(全国)
专利申请类型:发明专利;专利名称:基于增强拒绝采样训练的大语言模型对齐微调方法和系统
专利类型:发明专利
专利申请号:CN202410229872.9
专利申请(专利权)人:哈尔滨工业大学(深圳)(哈尔滨工业大学深圳科技创新研究院)
权利人地址:广东省深圳市南山区桃源街道深圳大学城哈尔滨工业大学校区
专利发明(设计)人:陈科海,江睿立,白雪峰,杨沐昀,赵铁军,张民
专利摘要:本发明公开了一种基于增强拒绝采样训练的大语言模型对齐微调方法和系统,涉及人工智能技术领域,包括:基于有监督微调后的大语言模型,为预设指令请求文本生成N条响应文本;基于训练好的奖励模型对每条响应文本进行评估,得到奖励分数;将N条响应文本按照对应的奖励分数由高到低排序,并选取前k条响应文本组成目标样本集;基于预设加权函数,计算每条响应文本对应的数据权重;基于预设指令请求文本、目标样本集中的响应文本和数据权重构建加权微调数据集,并基于加权微调数据集对有监督微调后的大语言模型进行对齐微调,得到目标大语言模型。本发明缓解了现有技术存在的过拟合风险高、易受有噪奖励分数干扰的技术问题。
主权利要求:
1.一种基于增强拒绝采样训练的大语言模型对齐微调方法,其特征在于,所述方法包括:基于有监督微调后的大语言模型,为预设指令请求文本生成N条响应文本;N为正整数;
基于训练好的奖励模型对每条响应文本进行评估,得到每条响应文本对应的奖励分数;
将所述N条响应文本按照对应的奖励分数由高到低排序,并选取前k条响应文本组成目标样本集;其中,1<k≤N;
基于预设加权函数,计算所述目标样本集中的每条响应文本对应的数据权重;所述预设加权函数为关于奖励分数的函数;
所述预设加权函数包括:
;
其中,fw表示预设加权函数, 表示第i个预设指令请求文本所生成的第n条响应文本对应的奖励分数, 表示第i个预设指令请求文本所生成的N条响应文本对应的奖励分数中的最大值,exp表示以自然常数e为底的指数函数;
基于所述预设指令请求文本、所述目标样本集中的响应文本和所述数据权重构建加权微调数据集,并基于所述加权微调数据集对所述有监督微调后的大语言模型进行对齐微调,得到目标大语言模型;
其中,基于所述加权微调数据集对所述有监督微调后的大语言模型进行对齐微调过程的目标函数包括:;
ARS
其中θ 为所述目标大语言模型的网络参数,θ表示有监督微调之前的大语言模型的网络参数,NI表示所述加权微调数据集的数据总数,wj为所述加权微调数据集中第j条数据的数据权重, 为预设指令请求文本Xj的条件下预测相应的响应文本Yj的概率;
在基于有监督微调后的大语言模型,为预设指令请求文本生成N条响应文本之前,所述方法还包括:利用符合人类预期与价值观的优质指令请求服从样本对预设大语言模型进行有监督的模仿学习,得到所述有监督微调后的大语言模型;利用人类对所述有监督微调后的大语言模型生成的不同指令响应文本符合人类预期与价值观程度的反馈数据,训练标量输出的奖励模型,得到训练好的奖励模型。
2.一种基于增强拒绝采样训练的大语言模型对齐微调系统,其特征在于,所述系统包括:生成模块,评估模块,选取模块,计算模块和微调模块;其中,所述生成模块,用于基于有监督微调后的大语言模型,为预设指令请求文本生成N条响应文本;N为正整数;
所述评估模块,用于基于训练好的奖励模型对每条响应文本进行评估,得到每条响应文本对应的奖励分数;
所述选取模块,用于将所述N条响应文本按照对应的奖励分数由高到低排序,并选取前k条响应文本组成目标样本集;其中,1<k≤N;
所述计算模块,用于基于预设加权函数,计算所述目标样本集中的每条响应文本对应的数据权重;所述预设加权函数为关于奖励分数的函数;
所述预设加权函数包括:
;
其中,fw表示预设加权函数, 表示第i个预设指令请求文本所生成的第n条响应文本对应的奖励分数, 表示第i个预设指令请求文本所生成的N条响应文本对应的奖励分数中的最大值,exp表示以自然常数e为底的指数函数;
所述微调模块,用于基于所述预设指令请求文本、所述目标样本集中的响应文本和所述数据权重构建加权微调数据集,并基于所述加权微调数据集对所述有监督微调后的大语言模型进行对齐微调,得到目标大语言模型;
其中,基于所述加权微调数据集对所述有监督微调后的大语言模型进行对齐微调过程的目标函数包括:;
ARS
其中θ 为所述目标大语言模型的网络参数,θ表示有监督微调之前的大语言模型的网络参数,NI表示所述加权微调数据集的数据总数,wj为所述加权微调数据集中第j条数据的数据权重, 为预设指令请求文本Xj的条件下预测相应的响应文本Yj的概率;
所述系统还包括:学习模块和训练模块;其中,
所述学习模块,用于利用符合人类预期与价值观的优质指令请求服从样本对预设大语言模型进行有监督的模仿学习,得到所述有监督微调后的大语言模型;
所述训练模块,用于利用人类对所述有监督微调后的大语言模型生成的不同指令响应文本符合人类预期与价值观程度的反馈数据,训练标量输出的奖励模型,得到训练好的奖励模型。
3.一种电子设备,其特征在于,包括:存储器、处理器和存储在所述存储器上并可在所述处理器上运行的计算机程序,所述处理器执行所述计算机程序时实现如权利要求1所述的方法。
4.一种计算机可读取存储介质,其特征在于,所述计算机可读取存储介质中存储有程序代码,所述程序代码可被处理器调用执行如权利要求1所述的方法。 说明书 : 基于增强拒绝采样训练的大语言模型对齐微调方法和系统技术领域[0001] 本发明涉及人工智能技术领域,特别是指一种基于增强拒绝采样训练的大语言模型对齐微调方法和系统。背景技术[0002] 大规模预训练语言模型是当前广为使用的各类聊天机器人的基础,这些大规模生成式深度神经网络模型通过在各领域的大规模文本语料库上进行已知前文、预测下文的自监督预训练,实现了对人类自然语言概率分布的建模,在给定前文语境文本的条件下通过对输出词语预测分布的采样即可实现流畅、自然的文本生成,并在各类自然语言理解和生成任务中都有着出色的表现。然而,随着训练语料库的扩大,其中不可避免地包含有害、有偏见的内容,或是一些事实性错误,这些负面文段可能导致预训练大模型在响应使用者指令请求的过程中生成不符合预期或违背人类价值观的文本。为了让大模型能的生成文本够与人类的期望和价值观(如有用性、诚实性和无害性)保持一致,需要进行额外的对齐微调训练,使得大模型能够正确服从人类使用者的各类指令请求,只生成符合预期的响应文本。[0003] 目前,大模型对齐微调的典型技术为基于人类反馈强化学习(RLHF),该技术通常被认为是最有效的大模型对齐微调技术之一,使用该技术进行微调得到的大模型已被广泛应用于聊天机器人等应用中。RLHF技术一般包含三个阶段,分别是利用有监督学习方法令大模型模仿优质指令请求服从示例文本的有监督微调阶段,利用人类对大模型响应指令请求优劣程度的反馈数据训练标量输出奖励模型的奖励建模阶段,以及利用强化学习算法以最大化奖励模型输出奖励分数为目标训练大模型的强化学习阶段。在强化学习阶段中,典型的技术方案可简要概括为响应文本生成、奖励分数评估、模型参数更新等主要步骤的迭代运行,尽管这一方案能够很好地实现大模型对齐微调训练,但要实现这一方案,需要同时加载包括生成式大模型和奖励模型在内的多个神经网络模型,具有结构复杂、算力资源需求量大等不足。因此,一些现有的大模型对齐微调技术从简化算法结构、降低算力需求的角度出发,尝试改善上述不足。在现有技术中,拒绝采样微调技术在沿用通过RLHF前两阶段的基础上,在最后阶段令大模型对自身多次生成的指令请求响应文本中的最佳样本进行有监督微调,在符合人类期望与价值观方面实现自我改进。拒绝采样微调技术的算法流程简洁直观,在训练过程中仅需占用有监督学习所需的算力资源,也有相当一部分现有技术是在这一技术的基础上改进的。[0004] 然而,拒绝采样微调技术由于仅为指令请求数据集中的每条指令请求文本选取1条奖励分数最高的响应文本用于后续的大模型微调训练,存在着过拟合风险高、易受有噪奖励分数干扰等不足,使得使用该技术进行对齐微调的大模型对人类指令服从能力的改进有限,不能很好地达到大模型对齐微调的根本目的。发明内容[0005] 为了解决现有技术存在的上述技术问题,本发明实施例提供了一种基于增强拒绝采样训练的大语言模型对齐微调方法和系统。所述技术方案如下:[0006] 一方面,提供了一种基于增强拒绝采样训练的大语言模型对齐微调方法,所述方法包括:基于有监督微调后的大语言模型,为预设指令请求文本生成N条响应文本;N为正整数;基于训练好的奖励模型对每条响应文本进行评估,得到每条响应文本对应的奖励分数;将所述N条响应文本按照对应的奖励分数由高到低排序,并选取前k条响应文本组成目标样本集;其中,1<k≤N;基于预设加权函数,计算所述目标样本集中的每条响应文本对应的数据权重;所述预设加权函数为关于奖励分数的函数;基于所述预设指令请求文本、所述目标样本集中的响应文本和所述数据权重构建加权微调数据集,并基于所述加权微调数据集对所述有监督微调后的大语言模型进行对齐微调,得到目标大语言模型。[0007] 可选地,在基于有监督微调后的大语言模型,为预设指令请求文本生成N条响应文本之前,所述方法还包括:利用符合人类预期与价值观的优质指令请求服从样本对预设大语言模型进行有监督的模仿学习,得到所述有监督微调后的大语言模型;利用人类对所述有监督微调后的大语言模型生成的不同指令响应文本符合人类预期与价值观程度的反馈数据,训练标量输出的奖励模型,得到所述训练好的奖励模型。[0008] 可选地,所述预设加权函数包括: ,其中,fw表示预设加权函数, 表示第i个预设指令请求文本所生成的第n条响应文本对应的奖励分数, 表示第i个预设指令请求文本所生成的N条响应文本对应的奖励分数中的最大值,exp表示以自然常数e为底的指数函数。[0009] 可选地,基于所述加权微调数据集对所述有监督微调后的大语言模型进行对齐微ARS调过程的目标函数包括: ,其中θ 为所述目标大语言模型的网络参数,θ表示有监督微调之前的大语言模型的网络参数,NI表示所述加权微调数据集的数据总数,wj为所述加权微调数据集中第j条数据的数据权重, 为预设指令请求文本Xj的条件下预测相应的响应文本Yj的概率。[0010] 另一方面,提供了一种基于增强拒绝采样训练的大语言模型对齐微调系统,所述系统包括:生成模块,评估模块,选取模块,计算模块和微调模块;其中,所述生成模块,用于基于有监督微调后的大语言模型,为预设指令请求文本生成N条响应文本;N为正整数;所述评估模块,用于基于训练好的奖励模型对每条响应文本进行评估,得到每条响应文本对应的奖励分数;所述选取模块,用于将所述N条响应文本按照对应的奖励分数由高到低排序,并选取前k条响应文本组成目标样本集;其中,1<k≤N;所述计算模块,用于基于预设加权函数,计算所述目标样本集中的每条响应文本对应的数据权重;所述预设加权函数为关于奖励分数的函数;所述微调模块,用于基于所述预设指令请求文本、所述目标样本集中的响应文本和所述数据权重构建加权微调数据集,并基于所述加权微调数据集对所述有监督微调后的大语言模型进行对齐微调,得到目标大语言模型。[0011] 可选地,还包括:学习模块和训练模块;其中,所述学习模块,用于利用符合人类预期与价值观的优质指令请求服从样本对预设大语言模型进行有监督的模仿学习,得到所述有监督微调后的大语言模型;所述训练模块,用于利用人类对所述有监督微调后的大语言模型生成的不同指令响应文本符合人类预期与价值观程度的反馈数据,训练标量输出的奖励模型,得到所述训练好的奖励模型。[0012] 可选地,所述预设加权函数包括: ,其中,fw表示预设加权函数, 表示第i个预设指令请求文本所生成的第n条响应文本对应的奖励分数, 表示第i个预设指令请求文本所生成的N条响应文本对应的奖励分数中的最大值,exp表示以自然常数e为底的指数函数。[0013] 可选地,基于所述加权微调数据集对所述有监督微调后的大语言模型进行对齐微ARS调过程的目标函数包括: ,其中θ 为所述目标大语言模型的网络参数,θ表示有监督微调之前的大语言模型的网络参数,NI表示所述加权微调数据集的数据总数,wj为所述加权微调数据集中第j条数据的数据权重, 为预设指令请求文本Xj的条件下预测相应的响应文本Yj的概率。[0014] 另一方面,提供了一种电子设备,包括:存储器、处理器和存储在所述存储器上并可在所述处理器上运行的计算机程序,所述处理器执行所述计算机程序时实现如上述第一方面所述的方法。[0015] 另一方面,提供了一种计算机可读取存储介质,所述计算机可读取存储介质中存储有程序代码,所述程序代码可被处理器调用执行如上述第一方面所述的方法。[0016] 本发明实施例提供的技术方案带来的有益效果至少包括:本发明实施例不仅具有现有拒绝采样微调技术对并行算力资源需求不大的优势,仅需占用有监督学习所需的并行算力资源,还能通过在拒绝采样训练阶段增加训练样本,使微调后的大模型在响应训练数据之外的人类指令请求时过拟合风险更低,同时在人类偏好标注噪声难以完全避免的情况下仍保持有效,能更好地使大模型生成文本与人类的期望与价值观更为一致。附图说明[0017] 为了更清楚地说明本发明实施例中的技术方案,下面将对实施例描述中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本发明的一些实施例,对于本领域普通技术人员来讲,在不付出创造性劳动的前提下,还可以根据这些附图获得其他的附图。[0018] 图1是本发明实施例提供的一种基于增强拒绝采样训练的大语言模型对齐微调方法的流程图;[0019] 图2是本发明实施例提供的一种增强拒绝采样训练阶段的流程示意图;[0020] 图3是本发明实施例提供的一种基于增强拒绝采样训练的大语言模型对齐微调系统的示意图。具体实施方式[0021] 下面结合附图,对本发明中的技术方案进行描述。[0022] 在本发明实施例中,“示例地”、“例如”等词用于表示作例子、例证或说明。本发明中被描述为“示例”的任何实施例或设计方案不应被解释为比其它实施例或设计方案更优选或更具优势。确切而言,使用示例的一词旨在以具体方式呈现概念。此外,在本发明实施例中,“和/或”所表达的含义可以是两者都有,或者可以是两者任选其一。[0023] 为使本发明要解决的技术问题、技术方案和优点更加清楚,下面将结合附图及具体实施例进行详细描述。[0024] 实施例一[0025] 图1是根据本发明实施例提供的一种基于增强拒绝采样训练的大语言模型对齐微调方法的流程图。如图1所示,该方法具体包括如下步骤:[0026] 步骤S102,基于有监督微调后的大语言模型,为预设指令请求文本生成N条响应文本;N为正整数。[0027] 步骤S104,基于训练好的奖励模型对每条响应文本进行评估,得到每条响应文本对应的奖励分数。[0028] 步骤S106,将N条响应文本按照对应的奖励分数由高到低排序,并选取前k条响应文本组成目标样本集;其中,1<k≤N。[0029] 步骤S108,基于预设加权函数,计算目标样本集中的每条响应文本对应的数据权重;预设加权函数为关于奖励分数的函数。[0030] 作为本发明的一种可选实施方式,预设加权函数包括:[0031][0032] 其中,fw表示预设加权函数, 表示第i个预设指令请求文本所生成的第n条响应文本对应的奖励分数, 表示第i个预设指令请求文本所生成的N条响应文本对应的奖励分数中的最大值,exp表示以自然常数e为底的指数函数。[0033] 步骤S110,基于预设指令请求文本、目标样本集中的响应文本和数据权重构建加权微调数据集,并基于加权微调数据集对有监督微调后的大语言模型进行对齐微调,得到目标大语言模型。[0034] 作为本发明的一种可选实施方式,基于加权微调数据集对有监督微调后的大语言模型进行对齐微调过程的目标函数包括:[0035][0036] 其中θARS为目标大语言模型的网络参数,θ表示有监督微调之前的大语言模型的网络参数,NI表示加权微调数据集的数据总数,wj为加权微调数据集中第j条数据的数据权重, 为预设指令请求文本Xj的条件下预测相应的响应文本Yj的概率。[0037] 具体的,在本发明实施例中,在步骤S102之前,还包括有监督微调阶段和奖励建模阶段。具体的,包括如下步骤:[0038] 步骤S100,利用符合人类预期与价值观的优质指令请求服从样本对预设大语言模型进行有监督的模仿学习,得到有监督微调后的大语言模型。[0039] 步骤S101,利用人类对有监督微调后的大语言模型生成的不同指令响应文本符合人类预期与价值观程度的反馈数据,训练标量输出的奖励模型,得到训练好的奖励模型。[0040] 本发明实施例提供的一种基于增强拒绝采样训练的大语言模型对齐微调方法,前两阶段,即有监督微调阶段(步骤S100)与奖励建模阶段(步骤S101)的实现与现有的拒绝采样微调技术是基本相同的,其中步骤S101中用于指令请求响应生成的大模型为步骤S100得到的有监督微调后的大语言模型。具体的,有监督微调阶段的训练数据集可表示为,其中(Xl,Yl)表示训练集的第l个由指令请求文本及相应的符合人类预期与价值观的优质响应文本构成的样本,该数据集通常由人类专家编写或选取,L表示有监督微调训练数据集的数据总数;该阶段的训练目标为最大化大模型在给定有监督微调数据集DSFT中指令请求文本Xl的条件下预测相应的响应文本Yl的概率 ,如下式所示:[0041][0042] 其中 表示大语言模型的网络参数,θSFT是初始化为有监督微调后的大语言模型的网络参数。[0043] 而奖励建模阶段的训练数据集通常可表示为 ,其中分别表示训练集的第m个样本中人类较为偏好、认为符合人类预期与价值观的优质指令请求响应文本及较不偏好、认为不符合预期或价值观的不够优质的响应文本,该数据集中的两类响应文本通常都由有监督微调后的大模型生成,即,M表示奖励建模训练数据集的数据总数;该阶段训练的奖励模型将用于评估某条指令请求文本X的响应文本Y符合人类预期与价值观程度,通过其输出的标量奖励分数 来具体体现,其训练目标为最大化奖励建模数据集DRM中指令请求文本Xm对应的人类偏好响应文本 的奖励分数大于非人类偏好响应文本 的奖励分数的概率,具体可表示为:[0044][0045] 其中ϕ表示能够反映人类偏好程度的奖励模型网络参数, 表示奖励建模训练后的奖励模型网络参数, 表示Sigmoid函数,表示奖励模型评估某条指令请求文本的响应文本而输出的标量奖励分数。[0046] 图2是根据本发明实施例提供的一种增强拒绝采样训练阶段的流程示意图。如图2所示,在最后的增强拒绝采样训练阶段,所需的指令请求数据集DInst的形式,以及利用步骤S100得到的有监督微调后的大语言模型生成N条响应文本的过程(步骤S102)、利用步骤S101得到的训练好的奖励模型评估各条指令请求响应文本的奖励分数的过程(步骤S104),也与现有的拒绝采样微调技术中拒绝采样训练阶段中一致。在实际应用中,监督微调后的大语言模型、训练好的奖励模型以及指令请求数据集均可使用现有公开的模型与数据,也可自行训练、收集。[0047] 考虑到奖励分数即便在有噪的情况下仍应在一定程度上反映了指令请求响应文本的优劣,且次优响应文本对大模型微调的作用应当小于最优响应文本的作用,步骤S106将步骤S102中对每条预设指令请求文本生成的N条响应文本按其对应的奖励分数由高至低排序,并选取前 条响应文本,利用适当的加权函数 计算这些响应文本的数据权重 ,其中 表示指令请求文本Xi的某一条被选取的响应文本 对应的奖励分数, 则为这些奖励分数中的最大值。[0048] 在本发明实施例中,加权函数应当满足如下特性:将最大的奖励分数赋予权值1,表明对应的响应文本对大模型微调的作用与常规情况下一致;其余奖励分数的权值均小于1、大于0,并随奖励分数减小而减小,奖励分数越小则权值越接近0,表明对应的响应文本对大模型微调的作用随奖励分数减小而衰减。优选地,一种满足上述条件的可用的加权函数可表示为:[0049] 。[0050] 而对于未被选取的响应文本 ,其对应的数据权重则为 ,表明这些响应文本不会对大模型微调产生作用。综上,对指令请求文本Xi的所有响应文本,其对应的数据权重可表示为:[0051][0052] 步骤S108中得到的数据权重可在步骤S110中与相应的预设指令请求文本和响应文本共同构成新的加权微调数据集 ,并用于大模型有监督加权微调,其中的预设指令请求文本Xj可取遍DInst中的样本Xi,Yj,wj则需取遍与Xi对应的所有响应文本Yi,n与数据权重wi,n。有监督加权微调训练的训练目标为最大化数据权重wj加权后大模型在给定DARS中指令请求文本Xj的条件下预测相应的响应文本Yj的概率 ,具体可表示为:[0053][0054] 其中θ表示大语言模型的网络参数,初始化为步骤S100得到的有监督微调后的大SFT ARS语言模型的网络参数θ ,θ 表示步骤S110得到的增强拒绝采样微调大模型(即目标大语言模型)的网络参数。[0055] 在实际应用中,由于 的训练样本并未对大模型微调过程中的参数更新产生直接影响,可考虑将其从微调数据集DARS中移除,以减少不必要的运算开销。训练过程中,需对一些超参数进行设置,包括为每条指令请求文本生成响应文本的次数N,为每条指令请求文本选取的响应文本数量k,以及训练所用参数更新算法的初始学习率、各批次中样本数等参数,其具体值应根据训练效果进行适当调整。[0056] 由以上描述可知,本发明实施例提供了一种基于增强拒绝采样训练的大语言模型对齐微调方法,在现有拒绝采样微调技术的基础上,将拒绝采样训练阶段改进为增强拒绝采样训练阶段,为指令请求数据集DInst中的每条指令请求文本选取1条以上的响应文本用于后续微调训练,以增加有监督微调数据集的样本数量,提高指令请求响应文本的多样性,降低过拟合风险,增强对齐微调后大模型正确响应新的人类指令请求的能力;同时,选取更多样本意味着有更高概率选出最优样本,从而能够减轻奖励分数噪声对对齐微调过程的负面影响,在奖励分数有噪的情况下保持微调训练的有效性。[0057] 实施例二[0058] 图3是根据本发明实施例提供的一种基于增强拒绝采样训练的大语言模型对齐微调系统的示意图。如图3所示,该系统包括:生成模块10,评估模块20,选取模块30,计算模块40和微调模块50。[0059] 具体的,生成模块10,用于基于有监督微调后的大语言模型,为预设指令请求文本生成N条响应文本;N为正整数。[0060] 评估模块20,用于基于训练好的奖励模型对每条响应文本进行评估,得到每条响应文本对应的奖励分数。[0061] 选取模块30,用于将N条响应文本按照对应的奖励分数由高到低排序,并选取前k条响应文本组成目标样本集;其中,1<k≤N。[0062] 计算模块40,用于基于预设加权函数,计算目标样本集中的每条响应文本对应的数据权重;预设加权函数为关于奖励分数的函数。[0063] 微调模块50,用于基于预设指令请求文本、目标样本集中的响应文本和数据权重构建加权微调数据集,并基于加权微调数据集对有监督微调后的大语言模型进行对齐微调,得到目标大语言模型。[0064] 具体的,如图3所示,该系统还包括:学习模块60和训练模块70。[0065] 具体的,学习模块60,用于利用符合人类预期与价值观的优质指令请求服从样本对预设大语言模型进行有监督的模仿学习,得到有监督微调后的大语言模型;[0066] 训练模块70,用于利用人类对有监督微调后的大语言模型生成的不同指令响应文本符合人类预期与价值观程度的反馈数据,训练标量输出的奖励模型,得到训练好的奖励模型。[0067] 优选地,预设加权函数包括:[0068][0069] 其中,fw表示预设加权函数, 表示第i个预设指令请求文本所生成的第n条响应文本对应的奖励分数, 表示第i个预设指令请求文本所生成的N条响应文本对应的奖励分数中的最大值,exp表示以自然常数e为底的指数函数。[0070] 优选地,基于加权微调数据集对有监督微调后的大语言模型进行对齐微调过程的目标函数包括:[0071][0072] 其中θARS为目标大语言模型的网络参数,θ表示有监督微调之前的大语言模型的网络参数,NI表示加权微调数据集的数据总数,wj为加权微调数据集中第j条数据的数据权重, 为预设指令请求文本Xj的条件下预测相应的响应文本Yj的概率。[0073] 本发明实施例还提供了一种电子设备,包括:存储器、处理器和存储在存储器上并可在处理器上运行的计算机程序,处理器执行计算机程序时实现如实施例一中的方法。[0074] 本发明实施例还提供了一种计算机可读取存储介质,计算机可读取存储介质中存储有程序代码,程序代码可被处理器调用执行如实施例一中的方法。[0075] 应理解,在本发明的各种实施例中,上述各过程的序号的大小并不意味着执行顺序的先后,各过程的执行顺序应以其功能和内在逻辑确定,而不应对本发明实施例的实施过程构成任何限定。[0076] 本领域普通技术人员可以意识到,结合本文中所公开的实施例描述的各示例的单元及算法步骤,能够以电子硬件、或者计算机软件和电子硬件的结合来实现。这些功能究竟以硬件还是软件方式来执行,取决于技术方案的特定应用和设计约束条件。专业技术人员可以对每个特定的应用来使用不同方法来实现所描述的功能,但是这种实现不应认为超出本发明的范围。[0077] 所属领域的技术人员可以清楚地了解到,为描述的方便和简洁,上述描述的设备、装置和单元的具体工作过程,可以参考前述方法实施例中的对应过程,在此不再赘述。[0078] 在本发明所提供的几个实施例中,应该理解到,所揭露的设备、装置和方法,可以通过其它的方式实现。例如,以上所描述的装置实施例仅仅是示意性的,例如,所述单元的划分,仅仅为一种逻辑功能划分,实际实现时可以有另外的划分方式,例如多个单元或组件可以结合或者可以集成到另一个设备,或一些特征可以忽略,或不执行。另一点,所显示或讨论的相互之间的耦合或直接耦合或通信连接可以是通过一些接口,装置或单元的间接耦合或通信连接,可以是电性,机械或其它的形式。[0079] 所述作为分离部件说明的单元可以是或者也可以不是物理上分开的,作为单元显示的部件可以是或者也可以不是物理单元,即可以位于一个地方,或者也可以分布到多个网络单元上。可以根据实际的需要选择其中的部分或者全部单元来实现本实施例方案的目的。[0080] 另外,在本发明各个实施例中的各功能单元可以集成在一个处理单元中,也可以是各个单元单独物理存在,也可以两个或两个以上单元集成在一个单元中。[0081] 所述功能如果以软件功能单元的形式实现并作为独立的产品销售或使用时,可以存储在一个计算机可读取存储介质中。基于这样的理解,本发明的技术方案本质上或者说对现有技术做出贡献的部分或者该技术方案的部分可以以软件产品的形式体现出来,该计算机软件产品存储在一个存储介质中,包括若干指令用以使得一台计算机设备(可以是个人计算机,服务器,或者网络设备等)执行本发明各个实施例所述方法的全部或部分步骤。而前述的存储介质包括:U盘、移动硬盘、只读存储器(read‑onlymemory,ROM)、随机存取存储器(randomaccessmemory,RAM)、磁碟或者光盘等各种可以存储程序代码的介质。[0082] 以上所述,仅为本发明的具体实施方式,但本发明的保护范围并不局限于此,任何熟悉本技术领域的技术人员在本发明揭露的技术范围内,可轻易想到变化或替换,都应涵盖在本发明的保护范围之内。因此,本发明的保护范围应以所述权利要求的保护范围为准。
专利地区:广东
专利申请日期:2024-02-29
专利公开日期:2024-05-31
专利公告号:CN117852616B