清静行业大模子的前因后果
宣布时间 2024-04-23将知识注入到大模子中
大模子在下游清静领域使命中体现往往欠佳,通常被以为缺乏领域知识和应用领域知识的方法。下图枚举了现在主流的大模子调优手艺:

关于L1清静行业大模子,主要使用右半图的手艺(增量预训练、有监视微调、人类反响强化学习),通过更新模子参数,来获得一个具备更强清静知识的大模子;关于L2应用场景层,则会使用左半图的手艺(检索增强天生、上下文学习),使大模子在现实场景中无需更新参数即可快速落地。
别的,将这些手艺区分为“注入知识”和“注入应用知识的方法”两种。注入知识(上半图)主要目的是让大模子获得清静领域知识,能够在回覆时有理有据而不是凭空捏造;而注入应用知识的方法(下半图)主要目的是教会大模子应用知识,希望大模子的回覆能够依循特命名堂或特定思绪。
尤其是人类反响强化学习手艺,是希望大模子能够对齐人类认知,在合理应用知识的同时,提升回覆的可用性和清静性。
接下来,将划分先容这些手艺的应用方法和优弱点。
增量预训练
增量预训练(Continuous Pre-train,CPT)是一种常见的知识注入方法。大模子主要是依赖学习大宗通用知识获得,通过将领域知识与通用知识混淆,然后使用这些数据继续训练原有L0基础大模子,增添了领域知识在训练数据中的比重,即增添了原有模子的领域知识。这种思绪显然是合理且有用的。
优点:注入模子的数据不需要人工打标,算法职员只需要对数据做去重、去广告等洗濯事情,不需要逐条对数据做细腻处置惩罚。
弱点:主要在于数据和算力本钱高。它不但对算力的要求相对偏高,也需要大宗全心洗濯的领域知识数据。
因此,增量预逊获取的数据通�?梢杂薪洗笞诩�,注入的知识也较为周全。
有监视微调
有监视微调(Supervised Fine-tuning,SFT)是指基于已有的大模子,在有标注数据上举行模子训练。现有的SFT手艺通常无需微调模子的所有参数,仅微调少量(或特殊)模子参数,显著降低盘算和安排本钱,同时爆发与全量微调模子相当的性能。通过这种方法,可以在消耗级硬件上训练和存储大模子,让大模子顺应种种下游应用。
优点:需求的数据量并不大,使用最低百条数据微调往往就能让大模子学会一些简朴的思绪与名堂。
弱点:用于微调大模子的数据通常需要极其细腻化的洗濯和逐条的人工打标。
举例来更好地诠释上文提及的手艺看法:在清静运营场景中,用户希望大模子对已知的清静事务举行解读,包括告警内容、事务类型、攻击手法、资产属性等。这样的应用场景需要这样完成:
首先,使用大宗果真的网络清静与主机清静相关知识对大模子做增量预训练;
其次,使用清静专家标注后的如下问答对,对我们的清静大模子举行有监视微调;

最后,就获得了可以在现实场景中使用的模子。
可是,对每一个下游使命我们都需要做微调吗?关于一些简朴的使命,这样的应用方法是否过于重大和冗余了呢?于是,我们引入了一些不需要更新模子参数的手艺,它们同样能有优异的使用效果。
检索增强天生
检索增强天生(Retrieval Augmented Generation,RAG)是时下热门的大模子应用解决计划。它的主要原理是由用户提出问题,通过类似搜索引擎的方法,从知识库中找到相关的知识片断,随后将用户的问题与搜索的效果一同输入给大模子,让大模子对着∥拷寮谜底”天生回覆。

优点:相比于增量预训练,检索增强天生的本钱更低,且知识更新更快。
弱点:检索增强天生对知识库的质量要求较高,要求最后获得的相关知识片断确实提供了回覆用户问题所需要的知识,且能够被大模子顺遂明确。
但在实践中,使用增量预训练照旧检索增强天生并不是单选题,可以选择“全都要”,同时享受两种手艺的优点。
上下文学习
上下文学习(In-context Learning,ICL)即提醒学习,也叫语境学习、使命相关的类比样本中学习等。当输入问题时,只需给大模子出一些“树模”性子的提醒,即可让大模子凭证树模来天生回覆。通常使用上下文学习的用户问题名堂如下所示。

优点:是一种很是便当的要领,关于差别的下游使命,不需要调解模子参数,只需要凭证提醒,就能够完成特定的使命。
弱点:关于重大的问题,简朴的提醒往往很难起到优异的效果。
我们似乎可以不再对每一个下游使命都举行有监视微调,而是用越发无邪的方法完成上面的清静运营场景(关于和之前办法差别的地方,我们做了加粗标注):
首先,我们使用大宗果真的网络清静与主机清静相关知识对大模子做增量预训练;
其次,我们使用清静专家标注后的多个差别清静使命场景下的问答对,对我们的清静大模子举行有监视微调;
再次,我们对每个单独的下游使命,使用检索增强天生和上下文学习来举行单独的使命提醒;
最后,获得最终天生的效果。
在现实应用场景中,大模子还需要通过人类反响强化学习获得更好的清静性和可用性;也需要借助智能系一切,使用一些类似于搜索引擎、数据库盘问、盘算器一类的工具来辅助完成使命。接下来划分先容这两项手艺。
人类反响强化学习
人类反响强化学习(Reinforcement Learning from Human Feedback,RLHF)手艺,主要目的是通过将人类的反响纳入训练历程,为机械提供自然的、人性化的互动学习历程。
在实践中,人类反响强化学习往往被用于提升大模子的清静性和可用性,清静性一样平常指用户询问不正当内容时大模子可以给出拒绝回覆,可用性则指大模子给出的回覆能够切实资助到用户。
值得注重的是,清静性和可用性也会相互影响,需要一直举行强化学习,阻止左支右绌。

智能体
智能体(Agent)是一个较重大的看法,也是一种新颖的大模子应用方法。它主要头脑是通过大模子构建一个智能体,让大模子通过逐步思索来妄想整个目的使命。
在智能体中,一个问题会被拆解为多个子�?�,然后通过从大模子天生的效果中剖析出其中挪用工具的内容,使用多种工具来逐步完成目的。每获得一次工具挪用效果,需要通过规则或大模子对获得的效果举行视察验证,确定这是否是用户想要的最终谜底。若是不是,则继续循环,将历史的所有用果举行总结并输入大模子,让大模子妄想下一办法的行动。

总得来说,智能体是让大模子解决重大问题的综合�?橛τ孟低�,通常与用户交互的智能对话机械人就是以这种方法实现的。
数据与算力——大模子的性能壁垒
综上所述,可以看出,大模子的应用现在主要受限于两大方面:
一是数据。更多的清静领域数据和实践运营数据对清静大模子是至关主要的。拥有足够优质的数据,意味着增量预训练中更多的清静知识,有监视微调中更专业的问答对,增强检索天生中更详实的知识库,“更多的人工,更多的智能”就体现于此。
二是算力。我们需要足够的算力维持大模子的训练和一样平常盘算(推理),更大的参数目、更多的训练数据这些都需要有足够的算力支持,才华够拿到效果。

清晰数据和算力的主要性,我们也着手为清静大模子提供了富厚的资源。尊龙凯官网入口依托中国移动算网资源优势,解决了模子训练和推理应用中的资源问题,基于自身沉淀的富厚的清静知识库、样本库、情报库,天生了清静领域的高质量语料库。
在一样平常清静运营中,可以实现自有清静产品到自有清静服务的闭环,也就是AI应用飞轮效应(用户越多,反响越多,AI能力越强),并通过元数据数字管理模式,实现数据到知识的转换,将自由清静产品和领域专家履历一连沉淀,完善和富厚清静领域大模子系统。


京公网安备11010802024551号