本平台为商业科创服务平台 非政府政务服务网站

基于深度学习的档案数据协同分析方法发明专利

更新时间:2026-06-11
基于深度学习的档案数据协同分析方法发明专利 专利申请类型:发明专利;
地区:广东-梅州;
源自:梅州高价值专利检索信息库;

专利名称:基于深度学习的档案数据协同分析方法

专利类型:发明专利

专利申请号:CN202410693047.4

专利申请(专利权)人:广东烟草梅州市有限公司
权利人地址:广东省梅州市梅江区坜明路

专利发明(设计)人:廖莉莉,林艺生,谢欣,吴瑞玲,李琨,朱春燕

专利摘要:本发明涉及深度学习技术领域,尤其涉及基于深度学习的档案数据协同分析方法,包括通过按照属性或特征对数据进行划分,形成各个学习区域;通过对每个学习子区域的数据进行特征提取,为后续数据处理和分析提供基础信息;通过将获取的文本、图像和视频数据的特征向量进行汇总和整合,形成综合特征向量;通过第一深度学习集合和第二深度学习集合进行协同分析,得到协同分析偏离量,并对其进行进一步的处理和分析,以获得更深层次的洞察和理解,提供更全面、更准确的分析结果和决策支持。本发明用于解决现有方案中没有对档案数据进行深度学习和协同分析,导致档案数据分析效果不佳的的技术问题。

主权利要求:
1.基于深度学习的档案数据协同分析方法,其特征在于:步骤一、获取目标档案数据,划分数据全域得到不同属性学习区域,进而得到对应的学习子区域;
步骤二、针对学习子区域构建档案节点树,所述档案节点树包括根节点、父节点以及子节点;
步骤三、结合节点树的层次结构和排列组合对档案节点树的根节点、父节点以及子节点建立关系;
步骤四、对每个学习子区域的数据进行特征提取,并统计所有学习子区域的子节点数量;
步骤五、引入矩阵向量,汇集获取的文本特征向量、图像特征向量以及视频特征向量,并联合三种特征向量形成该学习子区域的综合特征向量;
步骤六、采用聚类分析算法获取标识值,对标识值处理分析得到第一深度学习集合;
步骤七、根据档案数据的查询信息和操作记录将文本信息、图像信息以及视频信息进行实体识别和抽取,获取实体区段,并对实体区段处理分析得到第二深度学习集合;
步骤八、根据第一深度学习集合和第二深度学习集合协同分析,获取协同分析偏离量,并对协同分析偏离量进一步处理分析;
其中所述步骤一,获取目标档案数据,划分数据全域得到不同属性学习区域,进而得到对应的学习子区域的过程包括:获取目标档案数据,并进行数据全域划分;其中,数据全域包括第一属性学习区域,第二属性学习区域,第三属性学习区域,……,第m属性学习区域;m表示划分的属性学习区域的数量;
将所有属性学习区域标记为SXQ;其中,各种不同属性学习区域表示不同属性类别的目标档案数据,每个属性类别对应一个学习区域;
每个属性学习区域包括至少一个学习子区域 ;将所述学习子区域按照存储的文件格式细分;其中,w、p以及v分别表示文本学习子区域、图像学习子区域以及视频学习子区域;
其中所述步骤二,针对学习子区域构建档案节点树的过程包括:按照学习子区域的不同存储格式创建对应的根节点;
针对所述根节点创建若干父节点;
基于若干父节点创建对应的子节点;
其中所述步骤三,结合节点树的层次结构和排列组合对档案节点树的根节点、父节点以及子节点建立关系的过程包括:若学习子区域 ,则该学习子区域为文本学习子区域,将所述文本学习子区域的文本数据作为根节点,并将文本数据的文本参数记为父节点,同时将文本参数的文本类型、关键词、索引描述、页码范围、日期以及文本大小记作子节点;
若学习子区域 ,则该学习子区域为图像学习子区域,将所述图像学习子区域的图像数据作为根节点,并将图像数据的图像参数记为父节点,同时将图像参数的项目类型、日期以及图像大小记作子节点;
若学习子区域 ,则该学习子区域为视频学习子区域,将所述视频学习子区域的视频数据作为根节点,并将视频数据的视频参数记为父节点,同时将视频参数的项目类型、日期以及视频大小记作子节点;
其中所述步骤四,对每个学习子区域的数据进行特征提取,并统计所有学习子区域的子节点数量的过程包括:将不同学习子区域的子节点进行提取特征分别得到文本特征、图像特征以及视频特征;获取相应文本特征的子节点数量包 、图像特征的子节点数据包 以及视频特征的子节点数据包
;
其中,d表示文本特征的子节点数量包的编号,且d=1,2,……,n;n表示文本特征的子节点数量包的总数;f表示图像特征的子节点数据包的编号,且f=1,2,……,k;k表示图像特征的子节点数据包的总数;g表示视频特征的子节点数据包的编号,且g=1,2,……,j;j表示视频特征的子节点数据包的总数;
其中所述步骤五,引入矩阵向量,汇集获取的文本特征向量、图像特征向量以及视频特征向量,并联合三种特征向量形成该学习子区域的综合特征向量的过程包括:基于数据特征提取和子节点数量统计结果引入矩阵向量记号:, , ,
利用公式计算得到学习子区域的综合特征向量X;其中,
;式中,a为发展系数,bi为支撑系数,D为支撑项,r为支撑项D的支撑指数,R为不同特征向量的预设比例系数;i=1,2,……,u;且0<u<1,r为大于0的实数;
其中所述步骤六,采用聚类分析算法获取标识值,对标识值处理分析得到第一深度学习集合的过程包括:利用聚类分析算法L将获取的综合特征向量X映射为一个标识值SY:SY=L(X);其中,聚类分析算法选择K‑Means算法;
通过将时间戳附加到标识值SY上,形成该学习子区域的唯一标识值SY0;
获取各个学习子区域的唯一标识值集合,并合并成第一深度学习集合;
其中所述步骤七,根据档案数据的查询信息和操作记录将文本信息、图像信息以及视频信息进行实体识别和抽取,获取实体区段,并对实体区段处理分析得到第二深度学习集合的过程包括:从文本、图像以及视频信息中抽取实体和关系信息,获取单个或任意多个三元组;
将抽取的实体和关系信息存入学习三元组集合Trip;其中的元素是形式为(c,h,t)的三元组;其中,c、h以及t分别表示文本元素、图像元素以及视频元素;
统计数据库中档案数据的查询次数xs和操作频次zp;
根据学习三元组集合中的数据生成实体区段;
使用生成的实体区块构建三元学习关系得到三元学习指数 ;其中,三元学习指数的表达式为: ;式中,ℇ表示实体区段的标准变化参数, 分别为不同的三元权重比例系数;
通过三元学习关系表达式设置各实体区段的唯一基准值 ,并合并获取第二深度学习集合;
其中所述步骤八,根据第一深度学习集合和第二深度学习集合协同分析,获取协同分析偏离量,并对协同分析偏离量进一步处理分析的过程包括:获取第一深度学习集合H1和第二深度学习集合H2;对第一深度学习集合H1和第二深度学习集合H2进行积分,计算得到协同分析偏离量PL;其中,协同分析偏离量的公式为:;式中, 和 分别代表第一深度学习集合和第二深度
学习集合中的实体区段或学习子区域,函数 是衡量两个实体区段之间关系的指标或度量方法,积分符号∫表示对所有实体区段或学习子区域进行积分;
设置协同分析偏离量的临界阈值;将获取的各个协同分析偏离量与预设的临界阈值进行比较;
筛选出小于预设的临界阈值的协同分析偏离量,并统计筛选出的协同分析偏离量的数量G;若G小于等于1,则将筛选出的协同分析偏离量对应的第一深度学习集合作为协同分析最佳方案;若G大于1,则将第一深度学习集合清除,并自动生成清除信号,同时重新获取第一深度学习集合,重复以上操作。 说明书 : 基于深度学习的档案数据协同分析方法技术领域[0001] 本发明涉及深度学习技术领域,尤其涉及基于深度学习的档案数据协同分析方法。背景技术[0002] 深度学习是一种机器学习方法,通过构建具有多层次的神经网络来学习和理解复杂的数据模式。数据协同分析方法是一种利用多种数据源和多种分析技术进行综合分析的方法。[0003] 数据协同分析方法通常应用于各种领域,例如商业智能和数据分析、金融和风险管理、城市规划和智慧城市以及制造业和供应链管理等。目前在档案数据分析过程中,通过整合不同来源、不同类型的数据,并运用统计分析、机器学习、数据挖掘等方法,来发现数据之间的关联和规律,从而实现对档案数据进行高效分析。[0004] 但在数据分析过程中,获取的档案数据可能存在数据量过大或数据不稳定问题。另外计算资源消耗大,并且数据具有复杂的结构和关联关系,限制了数据资源整合,无法对所有档案数据进行精准分析且具有挑战性,导致需要处理分析的数据混乱繁琐,耽误工作进度。发明内容[0005] 本发明的目的是为了解决背景技术中的问题,而提出的基于深度学习的档案数据协同分析方法。[0006] 为了实现上述目的,本发明采用了如下技术方案:[0007] 基于深度学习的档案数据协同分析方法,包括:[0008] 步骤一、获取目标档案数据,划分数据全域得到不同属性学习区域,进而得到对应的学习子区域;[0009] 步骤二、针对学习子区域构建档案节点树,所述档案节点树包括根节点、父节点以及子节点;[0010] 步骤三、结合节点树的层次结构和排列组合对档案节点树的根节点、父节点以及子节点建立关系;[0011] 步骤四、对每个学习子区域的数据进行特征提取,并统计所有学习子区域的子节点数量;[0012] 步骤五、引入矩阵向量,汇集获取的文本特征向量、图像特征向量以及视频特征向量,并联合三种特征向量形成该学习子区域的综合特征向量;[0013] 步骤六、采用聚类分析算法获取标识值,对标识值处理分析得到第一深度学习集合;[0014] 步骤七、根据档案数据的查询信息和操作记录将文本信息、图像信息以及视频信息进行实体识别和抽取,获取实体区段,并对实体区段处理分析得到第二深度学习集合;[0015] 步骤八、根据第一深度学习集合和第二深度学习集合协同分析,获取协同分析偏离量,并对协同分析偏离量进一步处理分析。[0016] 需要说明的是,本发明提出的基于深度学习的档案数据协同分析方法,能够充分利用数据之间的相互关系和互补性,提供更全面、更准确的分析结果和决策支持,帮助用户更好地理解数据背后的信息,发现潜在的问题和机会,并提供有效的解决方案。[0017] 进一步的,获取目标档案数据,划分数据全域得到不同属性学习区域,进而得到对应的学习子区域的过程包括:[0018] 获取目标档案数据,并进行数据全域划分;其中,数据全域包括第一属性学习区域,第二属性学习区域,第三属性学习区域,……,第m属性学习区域;m表示划分的属性学习区域的数量;[0019] 将所有属性学习区域标记为SXQ;其中,各种不同属性学习区域表示不同属性类别的目标档案数据,每个属性类别对应一个学习区域;[0020] 每个属性学习区域包括至少一个学习子区域 ;将所述学习子区域按照存储的文件格式细分;其中,w、p以及v分别表示文本学习子区域、图像学习子区域以及视频学习子区域。[0021] 进一步的,针对学习子区域构建档案节点树的过程包括:[0022] 按照学习子区域的不同存储格式创建对应的根节点;[0023] 针对所述根节点创建若干父节点;[0024] 基于若干父节点创建对应的子节点。[0025] 进一步的,结合节点树的层次结构和排列组合对档案节点树的根节点、父节点以及子节点建立关系的过程包括:[0026] 若学习子区域 ,则该学习子区域为文本学习子区域,将所述文本学习子区域的文本数据作为根节点,并将文本数据的文本参数记为父节点,同时将文本参数的文本类型、关键词、索引描述、页码范围、日期以及文本大小记作子节点;[0027] 若学习子区域 ,则该学习子区域为图像学习子区域,将所述图像学习子区域的图像数据作为根节点,并将图像数据的图像参数记为父节点,同时将图像参数的项目类型、日期以及图像大小记作子节点;[0028] 若学习子区域 ,则该学习子区域为视频学习子区域,将所述视频学习子区域的视频数据作为根节点,并将视频数据的视频参数记为父节点,同时将视频参数的项目类型、日期以及视频大小记作子节点。[0029] 进一步的,对每个学习子区域的数据进行特征提取,并统计所有学习子区域的子节点数量的过程包括:[0030] 将不同学习子区域的子节点进行提取特征分别得到文本特征、图像特征以及视频特征;获取相应文本特征的子节点数量包 、图像特征的子节点数据包 以及视频特征的子节点数据包;[0031] 其中,d表示文本特征的子节点数量包的编号,且d=1,2,……,n;n表示文本特征的子节点数量包的总数;f表示图像特征的子节点数据包的编号,且f=1,2,……,k;k表示图像特征的子节点数据包的总数;g表示视频特征的子节点数据包的编号,且g=1,2,……,j;j表示视频特征的子节点数据包的总数。[0032] 进一步的,引入矩阵向量,汇集获取的文本特征向量、图像特征向量以及视频特征向量,并联合三种特征向量形成该学习子区域的综合特征向量的过程包括:[0033] 基于数据特征提取和子节点数量统计结果引入矩阵向量记号:[0034] , , ,[0035] 利 用 公 式 计 算 得 到 学 习 子 区 域 的 综 合 特 征 向 量 X ;其 中 ,;式中,a为发展系数,bi为支撑系数,D为支撑项,r为支撑项D的支撑指数,R为不同特征向量的预设比例系数;i=1,2,……,u;且0<u<1,r为大于0的实数。[0036] 进一步的,采用聚类分析算法获取标识值,对标识值处理分析得到第一深度学习集合的过程包括:[0037] 利用聚类分析算法L将获取的综合特征向量X映射为一个标识值SY:SY=L(X);其中,聚类分析算法选择K‑Means算法;[0038] 需要说明的是,K‑Means算法是一种基于质心的聚类算法,它可以将数据点分成K个簇,并将数据点分配到最近的质心,从而实现数据的聚类;在K‑Means算法中,质心为每个聚类的中心点,代表该聚类中所有数据点的平均位置,质心的位置是动态变化的,是聚类的核心,用于确定数据点所属的聚类;K‑Means算法通过不断迭代,将数据点分配到最近的质心,并更新质心的位置,直到质心的位置不再发生变化;在本发明实施例中,将获取的综合特征向量X映射为一个标识值SY,该标识值由K‑Means算法确定,代表综合特征向量X所属的簇,每个簇都有一个固定的标识值,且为一个整数,代表簇的编号;因此,标识值SY是一个固定值,表示综合特征向量X所属的簇的编号,这种编号由K‑Means算法根据数据点的特征和距离计算得出;[0039] 通过将时间戳附加到标识值SY上,形成该学习子区域的唯一标识值SY0;[0040] 其中,通过对标识值打上时间戳,以获得唯一的标识值,确保根据每个唯一标识值追溯生成的确切时间点,有助于在档案数据协同分析方法中跟踪和识别不同时间点生成的标识值;[0041] 获取各个学习子区域的唯一标识值集合,并合并成第一深度学习集合。[0042] 进一步的,根据档案数据的查询信息和操作记录将文本信息、图像信息以及视频信息进行实体识别和抽取,获取实体区段,并对实体区段处理分析得到第二深度学习集合的过程包括:[0043] 从文本、图像以及视频信息中抽取实体和关系信息,获取单个或任意多个三元组;[0044] 将抽取的实体和关系信息存入学习三元组集合Trip;其中的元素是形式为(c,h,t)的三元组;其中,c、h以及t分别表示文本元素、图像元素以及视频元素;[0045] 统计数据库中档案数据的查询次数xs和操作频次zp;[0046] 根据学习三元组集合中的数据生成实体区段;[0047] 需要说明的是,实体区段是从文本、图像和视频等不同类型的信息中抽取出来的具有实体意义的部分;在信息抽取和实体识别过程中,它表示被识别出来并被认为具有特定实体含义的片段或部分,可以是一个单词、短语、句子、图像中的特定物体或场景,或者视频中的特定对象、动作或场景;举例说明实体区段:在文本信息中,存储信息中的一个字符、词或短语可以被识别为实体区段,比如"苹果"、"iPhone15"、"2024年年度报告"等;在图像信息中,特定的物体、人物或场景可以被识别为实体区段,比如一张照片中的"汽车"、"树木"、"路灯"等;在视频信息中,特定的对象、动作或场景可以被识别为实体区段,比如视频中的"行人过马路"、"飞机起飞"、"篮球比赛"等;实体区段的识别和抽取便于对文本、图像和视频等不同类型的信息进行结构化处理和分析,从而更好地理解数据内容,并支持后续的信息挖掘和分析工作;[0048] 使用生成的实体区块构建三元学习关系得到三元学习指数 ;其中,三元学习指数的表达式为: 式中,ℇ表示实体区段的标准变化参数, 分别为不同的三元权重比例系数;[0049] 通过三元学习关系表达式设置各实体区段的唯一基准值 ,并合并获取第二深度学习集合;[0050] 其中,唯一基准值 的获取步骤包括:确定c、h、t的具体值;根据给定的数据,计算 的值;将计算得到的 的值代入表达式中,按照给定的权重系数进行计算;重复以上步骤,根据计算数值大小将所有三元学习指数进行降序排列,剔除最大值和最小值取均值,得到唯一基准值 。[0051] 进一步的,根据第一深度学习集合和第二深度学习集合协同分析,获取协同分析偏离量,并对协同分析偏离量进一步处理分析的过程包括:[0052] 获取第一深度学习集合H1和第二深度学习集合H2;对第一深度学习集合H1和第二深度学习集合H2进行积分,计算得到协同分析偏离量PL;其中,协同分析偏离量的公式为:;式中, 和 分别代表第一深度学习集合和第二深度学习集合中的实体区段或学习子区域,函数 是衡量两个实体区段之间关系的指标或度量方法,积分符号∫表示对所有实体区段或学习子区域进行积分;[0053] 需要说明的是,多个实体区段构成一个学习实体区块,一个学习实体区块对应一个学习子区域;在积分公式中,函数 可能包括一系列特征之间的差异、相似度或其他相关性度量,可根据需要采用不同的方法来计算,例如,使用欧氏距离、相关系数、余弦相似度或其他度量方法来衡量两个者之间的偏离程度;需要注意的是,上述协同分析偏离量的公式只是一个框架,具体的计算方法和度量指标需要根据实际情况和数据特性进行选择和定义,因此,在实际应用中,需要根据具体情况对公式进行调整和优化;[0054] 设置协同分析偏离量的临界阈值;将获取的各个协同分析偏离量与预设的临界阈值进行比较;[0055] 筛选出小于预设的临界阈值的协同分析偏离量,并统计筛选出的协同分析偏离量的数量G;若G小于等于1,则将筛选出的协同分析偏离量对应的第一深度学习集合作为协同分析最佳方案;若G大于1,则将第一深度学习集合清除,并自动生成清除信号,同时重新获取第一深度学习集合,重复以上操作;[0056] 其中,上述分析过程可确保档案数据集中的异常情况得到及时处理,以提高档案数据协同分析的准确性和可靠性;通过以上步骤,可以在协同分析过程中及时发现和处理异常情况,从而保证档案数据分析结果的有效性和可信度。[0057] 与现有的技术相比,本发明提供了基于深度学习的档案数据协同分析方法的优点在于:[0058] 本发明通过收集目标档案数据,并按照不同的属性或特征对数据进行划分,形成各个学习区域,从而为后续的分析和处理做好准备;分析和处理档案节点树的结构,建立不同节点之间的关系,以便后续的数据分析和挖掘;[0059] 本发明通过对每个学习子区域的数据进行特征提取,以便后续的分析和建模;同时,统计每个学习子区域的子节点数量,为后续的数据处理和分析提供基础信息;将获取的文本、图像和视频数据的特征向量进行汇总和整合,形成每个学习子区域的综合特征向量;[0060] 本发明通过根据查询信息和操作记录,对文本、图像和视频信息进行实体识别和抽取,从而得到实体区段,并对实体区段进行处理和分析,形成第二深度学习集合,为后续决策提供参考依据。[0061] 本发明通过第一深度学习集合和第二深度学习集合进行协同分析,得到协同分析偏离量,并对其进行进一步的处理和分析,以获得更深层次的洞察和理解。[0062] 综上所述,本发明可以根据实际情况,对档案数据协同分析方法进行验证,实现信息共享和协同工作,提高了数据的利用效率和准确性,通过全面的数据分析,并涉及数据的划分、特征提取、聚类分析以及深度学习集合的生成和分析,有助于增强数据的可靠性和可用性,为提供可靠的支持和保障,确保后续基于深度学习的档案数据协同分析方法的正常实行。附图说明[0063] 图1为本发明提出的基于深度学习的档案数据协同分析方法的流程图。具体实施方式[0064] 下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施条例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。[0065] 参照图1,基于深度学习的档案数据协同分析方法,包括:[0066] 步骤一、获取目标档案数据,划分数据全域得到不同属性学习区域,进而得到对应的学习子区域;[0067] 步骤二、针对学习子区域构建档案节点树,所述档案节点树包括根节点、父节点以及子节点;[0068] 步骤三、结合节点树的层次结构和排列组合对档案节点树的根节点、父节点以及子节点建立关系;[0069] 步骤四、对每个学习子区域的数据进行特征提取,并统计所有学习子区域的子节点数量;[0070] 步骤五、引入矩阵向量,汇集获取的文本特征向量、图像特征向量以及视频特征向量,并联合三种特征向量形成该学习子区域的综合特征向量;[0071] 步骤六、采用聚类分析算法获取标识值,对标识值处理分析得到第一深度学习集合;[0072] 步骤七、根据档案数据的查询信息和操作记录将文本信息、图像信息以及视频信息进行实体识别和抽取,获取实体区段,并对实体区段处理分析得到第二深度学习集合;[0073] 步骤八、根据第一深度学习集合和第二深度学习集合协同分析,获取协同分析偏离量,并对协同分析偏离量进一步处理分析。[0074] 需要说明的是,本发明提出的基于深度学习的档案数据协同分析方法,能够充分利用数据之间的相互关系和互补性,提供更全面、更准确的分析结果和决策支持,帮助用户更好地理解数据背后的信息,发现潜在的问题和机会,并提供有效的解决方案。[0075] 所述步骤一中,获取目标档案数据,划分数据全域得到不同属性学习区域,进而得到对应的学习子区域的过程包括:[0076] S101、获取目标档案数据,并进行数据全域划分;其中,数据全域包括第一属性学习区域,第二属性学习区域,第三属性学习区域,……,第m属性学习区域;m表示划分的属性学习区域的数量;[0077] S102、将所有属性学习区域标记为SXQ;其中,各种不同属性学习区域表示不同属性类别的目标档案数据,每个属性类别对应一个学习区域:[0078] S103、每个属性学习区域包括至少一个学习子区域 ;将所述学习子区域按照存储的文件格式细分;其中,w、p以及v分别表示文本学习子区域、图像学习子区域以及视频学习子区域。[0079] 所述步骤二中,针对学习子区域构建档案节点树的过程包括:[0080] S201、按照学习子区域的不同存储格式创建对应的根节点;[0081] S202、针对所述根节点创建若干父节点;[0082] S203、基于若干父节点创建对应的子节点。[0083] 所述步骤三中,结合节点树的层次结构和排列组合对档案节点树的根节点、父节点以及子节点建立关系的过程包括:[0084] S301、若学习子区域 ,则该学习子区域为文本学习子区域,将所述文本学习子区域的文本数据作为根节点,并将文本数据的文本参数记为父节点,同时将文本参数的文本类型、关键词、索引描述、页码范围、日期以及文本大小记作子节点;[0085] S302、若学习子区域 ,则该学习子区域为图像学习子区域,将所述图像学习子区域的图像数据作为根节点,并将图像数据的图像参数记为父节点,同时将图像参数的项目类型、日期以及图像大小记作子节点;[0086] S303、若学习子区域 ,则该学习子区域为视频学习子区域,将所述视频学习子区域的视频数据作为根节点,并将视频数据的视频参数记为父节点,同时将视频参数的项目类型、日期以及视频大小记作子节点。[0087] 所述步骤四中,对每个学习子区域的数据进行特征提取,并统计所有学习子区域的子节点数量的过程包括:[0088] S401、将不同学习子区域的子节点进行提取特征分别得到文本特征、图像特征以及视频特征;获取相应文本特征的子节点数量包 、图像特征的子节点数据包 以及视频特征的子节点数据包;[0089] 其中,d表示文本特征的子节点数量包的编号,且d=1,2,……,n;n表示文本特征的子节点数量包的总数;f表示图像特征的子节点数据包的编号,且f=1,2,……,k;k表示图像特征的子节点数据包的总数;g表示视频特征的子节点数据包的编号,且g=1,2,……,j;j表示视频特征的子节点数据包的总数。[0090] 所述步骤五中,引入矩阵向量,汇集获取的文本特征向量、图像特征向量以及视频特征向量,并联合三种特征向量形成该学习子区域的综合特征向量的过程包括:[0091] S501、基于数据特征提取和子节点数量统计结果引入矩阵向量记号:[0092] , , ,利用公式计算得到学习子区域的综合特征向量X;其中, ;式中,a为发展系数,bi为支撑系数,D为支撑项,r为支撑项D的支撑指数,R为不同特征向量的预设比例系数;i=1,2,……,u;且0<u<1,r为大于0的实数。[0093] 所述步骤六中,采用聚类分析算法获取标识值,对标识值处理分析得到第一深度学习集合的过程包括:[0094] S601、利用聚类分析算法L将获取的综合特征向量X映射为一个标识值SY:SY=L(X);其中,聚类分析算法选择K‑Means算法;[0095] 需要说明的是,K‑Means算法是一种基于质心的聚类算法,它可以将数据点分成K个簇,并将数据点分配到最近的质心,从而实现数据的聚类;在K‑Means算法中,质心为每个聚类的中心点,代表该聚类中所有数据点的平均位置,质心的位置是动态变化的,是聚类的核心,用于确定数据点所属的聚类;K‑Means算法通过不断迭代,将数据点分配到最近的质心,并更新质心的位置,直到质心的位置不再发生变化;在本发明实施例中,将获取的综合特征向量X映射为一个标识值SY,该标识值由K‑Means算法确定,代表综合特征向量X所属的簇,每个簇都有一个固定的标识值,且为一个整数,代表簇的编号;因此,标识值SY是一个固定值,表示综合特征向量X所属的簇的编号,这种编号由K‑Means算法根据数据点的特征和距离计算得出;[0096] S602、通过将时间戳附加到标识值SY上,形成该学习子区域的唯一标识值SY0;[0097] 其中,通过对标识值打上时间戳,以获得唯一的标识值,确保根据每个唯一标识值追溯生成的确切时间点,有助于在档案数据协同分析方法中跟踪和识别不同时间点生成的标识值;[0098] S603、获取各个学习子区域的唯一标识值集合,并合并成第一深度学习集合。[0099] 所述步骤七中,根据档案数据的查询信息和操作记录将文本信息、图像信息以及视频信息进行实体识别和抽取,获取实体区段,并对实体区段处理分析得到第二深度学习集合的过程包括:[0100] S701、从文本、图像以及视频信息中抽取实体和关系信息,获取单个或任意多个三元组;[0101] S702、将抽取的实体和关系信息存入学习三元组集合Trip;其中的元素是形式为(c,h,t)的三元组;其中,c、h以及t分别表示文本元素、图像元素以及视频元素;[0102] S703、统计数据库中档案数据的查询次数xs和操作频次zp;[0103] S704、根据学习三元组集合中的数据生成实体区段;[0104] 需要说明的是,实体区段是从文本、图像和视频等不同类型的信息中抽取出来的具有实体意义的部分;在信息抽取和实体识别过程中,它表示被识别出来并被认为具有特定实体含义的片段或部分,可以是一个单词、短语、句子、图像中的特定物体或场景,或者视频中的特定对象、动作或场景;举例说明实体区段:在文本信息中,存储信息中的一个字符、词或短语可以被识别为实体区段,比如"苹果"、"iPhone15"、"2024年年度报告"等;在图像信息中,特定的物体、人物或场景可以被识别为实体区段,比如一张照片中的"汽车"、"树木"、"路灯"等;在视频信息中,特定的对象、动作或场景可以被识别为实体区段,比如视频中的"行人过马路"、"飞机起飞"、"篮球比赛"等;实体区段的识别和抽取便于对文本、图像和视频等不同类型的信息进行结构化处理和分析,从而更好地理解数据内容,并支持后续的信息挖掘和分析工作;[0105] S705、使用生成的实体区块构建三元学习关系得到三元学习指数 ;其中,三元学习指数的表达式为: ;式中,ℇ表示实体区段的标准变化参数, 分别为不同的三元权重比例系数;[0106] S706、通过三元学习关系表达式设置各实体区段的唯一基准值 ,并合并获取第二深度学习集合;[0107] 其中,唯一基准值 的获取步骤包括:确定c、h、t的具体值;根据给定的数据,计算 的值;将计算得到的 的值代入表达式中,按照给定的权重系数进行计算;重复以上步骤,根据计算数值大小将所有三元学习指数进行降序排列,剔除最大值和最小值取均值,得到唯一基准值 。[0108] 所述步骤八中,根据第一深度学习集合和第二深度学习集合协同分析,获取协同分析偏离量,并对协同分析偏离量进一步处理分析的过程包括:[0109] S801、获取第一深度学习集合H1和第二深度学习集合H2;对第一深度学习集合H1和第二深度学习集合H2进行积分,计算得到协同分析偏离量PL;其中,协同分析偏离量的公式为: ;式中, 和 分别代表第一深度学习集合和第二深度学习集合中的实体区段或学习子区域,函数 是衡量两个实体区段之间关系的指标或度量方法,积分符号∫表示对所有实体区段或学习子区域进行积分;[0110] 需要说明的是,多个实体区段构成一个学习实体区块,一个学习实体区块对应一个学习子区域;在积分公式中,函数 可能包括一系列特征之间的差异、相似度或其他相关性度量,可根据需要采用不同的方法来计算,例如,使用欧氏距离、相关系数、余弦相似度或其他度量方法来衡量两个者之间的偏离程度;需要注意的是,上述协同分析偏离量的公式只是一个框架,具体的计算方法和度量指标需要根据实际情况和数据特性进行选择和定义,因此,在实际应用中,需要根据具体情况对公式进行调整和优化;[0111] S802、设置协同分析偏离量的临界阈值;将获取的各个协同分析偏离量与预设的临界阈值进行比较;[0112] S803、筛选出小于预设的临界阈值的协同分析偏离量,并统计筛选出的协同分析偏离量的数量G;若G小于等于1,则将筛选出的协同分析偏离量对应的第一深度学习集合作为协同分析最佳方案;若G大于1,则将第一深度学习集合清除,并自动生成清除信号,同时重新获取第一深度学习集合,重复以上操作;[0113] 其中,上述分析过程可确保档案数据集中的异常情况得到及时处理,以提高档案数据协同分析的准确性和可靠性;通过以上步骤,可以在协同分析过程中及时发现和处理异常情况,从而保证档案数据分析结果的有效性和可信度。[0114] 本发明实施例中,通过收集目标档案数据,并按照不同的属性或特征对数据进行划分,形成各个学习区域,从而为后续的分析和处理做好准备,通过分析和处理档案节点树的结构,建立不同节点之间的关系,以便后续的数据分析和挖掘,通过统计每个学习子区域的子节点数量,为后续的数据处理和分析提供基础信息,通过将获取的文本、图像和视频数据的特征向量进行汇总和整合,形成每个学习子区域的综合特征向量,通过对实体区段进行处理和分析,形成第二深度学习集合,为后续决策提供参考依据,确保数据的质量和可靠性,通过第一深度学习集合和第二深度学习集合进行协同分析,得到协同分析偏离量,并对其进行进一步的处理和分析,以获得更深层次的洞察和理解。综上所述,本发明实例涉及到数据处理、特征提取和综合分析的决策,解决现有方案中没有对档案数据进行深度学习和协同分析,导致档案数据分析效果不佳的技术问题。在实际情况中,可能需要更多的数据和上下文信息来做出具体的决策和优化方案。[0115] 此外,上述中涉及的公式均是去除量纲取其数值计算,是由采集大量数据进行软件模拟得到最接近真实情况的一个公式,公式中的比例系数以及分析过程中各个预设的阈值由本领域的技术人员根据实际情况设定或者大量数据模拟获得;比例系数的大小是为了将各个参数进行量化得到的一个具体的数值,便于后续比较,关于比例系数的大小,取决于样本数据的多少及本领域技术人员对每一组样本数据初步设定对应的处理系数;只要不影响参数与量化后数值的比例关系即可。[0116] 本说明书中的各个实施例均采用递进的方式描述,各个实施例之间相同相似的部分互相参见即可,各个实施例重点说明的都是与其他实施例的不同之处。尤其,对于装置实施例而言,由于其基本依托于方法实施例,所以描述得比较简单,相关之处参见方法实施例的部分说明即可。[0117] 为了描述得方便,描述以上装置时以功能分为各种单元分别描述。当然,在实施本申请时可以把各单元的功能在同一个或多个软件和/或硬件中实现。[0118] 本领域内的技术人员应明白,本发明的实施例可提供为方法、系统、或计算机程序产品。因此,本发明可采用完全硬件实施例、完全软件实施例、或结合软件和硬件方面的实施例的形式。而且,本发明可采用在一个或多个其中包含有计算机可用程序代码的计算机可用存储介质(包括但不限于磁盘存储器、CD‑ROM、光学存储器等)上实施的计算机程序产品的形式。[0119] 本发明是参照根据本发明实施例的方法、设备(系统)、和计算机程序产品的流程图和/或方框图来描述的。应理解可由计算机程序指令实现流程图和/或方框图中的每一流程和/或方框、以及流程图和/或方框图中的流程和/或方框的结合。可提供这些计算机程序指令到通用计算机、专用计算机、嵌入式处理机或其他可编程数据处理设备的处理器以产生一个机器,使得通过计算机或其他可编程数据处理设备的处理器执行的指令产生用于实现在流程图一个流程或多个流程和/或方框图一个方框或多个方框中指定的功能的装置。[0120] 这些计算机程序指令也可存储在能引导计算机或其他可编程数据处理设备以特定方式工作的计算机可读存储器中,使得存储在该计算机可读存储器中的指令产生包括指令装置的制造品,该指令装置实现在流程图一个流程或多个流程和/或方框图一个方框或多个方框中指定的功能。[0121] 这些计算机程序指令也可装载到计算机或其他可编程数据处理设备上,使得在计算机或其他可编程设备上执行一系列操作步骤以产生计算机实现的处理,从而在计算机或其他可编程设备上执行的指令提供用于实现在流程图一个流程或多个流程和/或方框图一个方框或多个方框中指定的功能的步骤。[0122] 其次:本发明公开实施例附图中,只涉及与本公开实施例涉及的结构,其他结构可参考通常设计,在不冲突情况下,本发明同一实施例及不同实施例可以相互组合;[0123] 最后:以上所述仅为本发明较佳的具体实施方式,但本发明的保护范围并不局限于此,任何熟悉本技术领域的技术人员在本发明揭露的技术范围内,根据本发明的技术方案及其发明构思加以等同替换或改变,都应涵盖在本发明的保护范围之内。

专利地区:广东

专利申请日期:2024-05-31

专利公开日期:2024-11-05

专利公告号:CN118395124B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
搜索
搜本页
欢迎咨询

扫码可加微信,手机访问拨打咨询

欢迎咨询

欢迎咨询
数据加载中...