本平台为商业科创服务平台 非政府政务服务网站

实体数据可信校验方法、装置、存储介质和电子设备

更新时间:2026-10-01
实体数据可信校验方法、装置、存储介质和电子设备 专利申请类型:实用新型专利;
地区:辽宁-本溪;
源自:本溪高价值专利检索信息库;

专利名称:实体数据可信校验方法、装置、存储介质和电子设备

专利类型:实用新型专利

专利申请号:CN202410917327.9

专利申请(专利权)人:本溪钢铁(集团)信息自动化有限责任公司
权利人地址:辽宁省本溪市平山区广裕路130号

专利发明(设计)人:孙嘉怿,姚银河,张可,吕英霄

专利摘要:本申请提供了一种实体数据可信校验方法、装置、存储介质和电子设备,属于数据处理技术领域。该方法包括:获取实体数据集;基于所述实体数据集中的实体关联数据,构建实体节点有向链;基于所述实体节点有向链计算出各个实体的第一参考值;基于所述第一参考值从实体数据集中选取第一数量的实体作为参考节点;基于所述参考节点为实体节点设置第二初始参考值,基于所述第二初始参考值进行迭代,得到所述实体数据集中的每个实体节点的第二参考值;基于所述第二参考值确定出实体的可信度。本申请提高了实体可信度计算的准确性。

主权利要求:
1.一种实体数据可信校验方法,其特征在于,所述方法包括:获取实体数据集;
基于所述实体数据集中的实体关联数据,构建实体节点有向链;
根据所述实体节点有向链确定各个节点的出链数和入链数;
按照公式 计算出各个实体的第一参考值,所述实体的第
一参考值用来对实体的可信度提供参考,r(vi)表示节点vi在当前迭代下得到的第一参考值,n表示实体数据集中的节点总数,r(vj)表示节点vj的第一参考值;L(vj)表示节点vj的出链数,节点vj表示属于与节点vi存在关联关系的节点集合M(vi)中的节点,c表示关联概率;
基于所述第一参考值从实体数据集中选取第一数量x0的实体作为参考节点,x0
基于所述参考节点为实体节点设置第二初始参考值,基于所述第二初始参考值进行迭代,得到所述实体数据集中的每个实体节点的第二参考值,所述第二初始参考值为第一次迭代时使用的数值,所述第二参考值用于体现实体的可信度大小;
基于所述第二参考值确定出实体的可信度;
所述基于所述第二初始参考值进行迭代,得到所述实体数据集中的每个实体节点的第二参考值,包括:按照公式 进行迭代,直至迭代的次数达到第二次数阈值,或者两次迭代得到的差值处于第二差值阈值内时,终止迭代,并将最后一次迭代的输出值作为对应节点的第二参考值,其中,ti表示第i次迭代的输出值,T表示实体节点中存在关联关系的概率的变换矩阵,d表示当前节点与其他节点形成随机模型的线性向量,a表示概率参考因子。
2.根据权利要求1所述的方法,其特征在于,所述按照公式计算出各个实体的第一参考值,包括:
按照公式 进行迭代,直至迭代的次数达到第一次数阈
值,或者两次迭代得到的差值处于第一差值阈值内时,终止迭代,并将最后一次迭代得到的第一参考值作为对应实体的第一参考值。
3.根据权利要求1所述的方法,其特征在于,所述方法还包括:获取所述实体数据集中每种实体类型的类型数量;
所述基于所述第一参考值从实体数据集中选取第一数量x0的实体作为参考节点,包括:基于所述类型数量确定每种实体类型的参考节点数量,使每种实体类型的参考节点数量之和为所述第一数量x0;
基于属于相同实体类型中的实体的第一参考值选取出对应数量的节点作为所述参考节点。
4.根据权利要求3所述的方法,其特征在于,所述实体数据集包括实体的实体规模数据、实体经营数据、实体类型和所述实体关联数据中的一种或多种数据类型;
所述基于属于相同实体类型中的实体的第一参考值选取出对应数量的节点作为所述参考节点,包括:针对每种数据类型计算出实体对应的数据量化值,所述实体关联数据的数据量化值包括所述第一参考值;
获取每种数据类型对应的权值;
根据所述权值和所述数据量化值计算出实体的综合量化值;
根据所述综合量化值从每个实体类型中选取对应数量的节点作为所述参考节点。
5.一种实体数据可信校验装置,其特征在于,所述装置包括:数据集获取模块,用于获取实体数据集;
有向链构建模块,用于基于所述实体数据集中的实体关联数据,构建实体节点有向链;
第一参考值计算模块,用于根据所述实体节点有向链确定各个节点的出链数和入链数,按照公式 计算出各个实体的第一参考值,所述实体的第一参考值用来对实体的可信度提供参考,r(vi)表示节点vi在当前迭代下得到的第一参考值,n表示实体数据集中的节点总数,r(vj)表示节点vj的第一参考值;L(vj)表示节点vj的出链数,节点vj表示属于与节点vi存在关联关系的节点集合M(vi)中的节点,c表示关联概率;
可信度确定模块,用于基于所述第一参考值从实体数据集中选取第一数量x0的实体作为参考节点,x0
所述可信度确定模块还用于按照公式 进行迭代,直至迭代的次数达到第二次数阈值,或者两次迭代得到的差值处于第二差值阈值内时,终止迭代,并将最后一次迭代的输出值作为对应节点的第二参考值,其中,ti表示第i次迭代的输出值,T表示实体节点中存在关联关系的概率的变换矩阵,d表示当前节点与其他节点形成随机模型的线性向量,a表示概率参考因子。
6.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有可执行指令,所述可执行指令被处理器执行时使所述处理器执行如权利要求1至4中任一项所述的方法。
7.一种电子设备,其特征在于,包括:
一个或多个处理器;
存储器,用于存储一个或多个程序,当所述一个或多个程序被所述一个或多个处理器执行时,使得所述一个或多个处理器执行如权利要求1至4中任一项所述的方法。 说明书 : 实体数据可信校验方法、装置、存储介质和电子设备技术领域[0001] 本申请涉及数据处理技术领域,尤其涉及一种实体数据可信校验方法、装置、存储介质和电子设备。背景技术[0002] 在数据处理和分析领域,数据的质量和可信度对于决策过程至关重要。特别是在涉及多个实体(包括但不限于企业、组织、个人等)的交互场景中,如何准确、高效地校验这些实体的数据可信度,成为了亟待解决的问题。[0003] 传统上,对于实体数据的校验往往依赖于人工审核或简单的规则匹配,这种方式不仅效率低下,而且容易受到主观因素的影响,导致数据校验的不准确和不一致。随着大数据和人工智能技术的快速发展,利用智能算法对实体数据进行可信校验成为可能。[0004] 然而,目前关于实体数据可信校验的方法和技术仍然相对匮乏。在招投标、金融交易、供应链管理等涉及多个实体交互的领域中,由于缺乏有效的数据可信校验机制,导致了一系列的问题和风险,如欺诈行为、数据篡改、信息泄露等。[0005] 基于此,有必要提出一种新的实体数据可信校验方法,以提高数据可信校验的准确性,从而为实体之间的交互选择决策提供参考,降低实体交互的风险。发明内容[0006] 基于此,本申请的目的在于提供一种实体数据可信校验方法、装置、存储介质和电子设备,以解决上述至少一种问题。[0007] 本申请第一方面,提供了一种实体数据可信校验方法,所述方法包括:[0008] 获取实体数据集;[0009] 基于所述实体数据集中的实体关联数据,构建实体节点有向链;[0010] 基于所述实体节点有向链计算出各个实体的第一参考值,所述实体的第一参考值用来对实体的可信度提供参考;[0011] 基于所述第一参考值从实体数据集中选取第一数量的实体作为参考节点;[0012] 基于所述参考节点为实体节点设置第二初始参考值,基于所述第二初始参考值进行迭代,得到所述实体数据集中的每个实体节点的第二参考值,所述第二初始参考值为第一次迭代时使用的数值,所述第二参考值用于体现实体的可信度大小;[0013] 基于所述第二参考值确定出实体的可信度。[0014] 在其中一个实施例中,所述基于所述实体节点有向链计算出各个实体的第一参考值,包括:根据所述实体节点有向链确定各个节点的出链数和入链数;根据所述出链数和入链数以及预设的关联概率计算出各个实体的第一参考值。[0015] 在其中一个实施例中,所述基于所述实体节点有向链计算出各个实体的第一参考值,包括:根据所述出链数和入链数以及预设的关联概率计算出各个实体的第一初始参考值;针对所述第一初始参考值进行迭代,得到各个实体的第一参考值。[0016] 在其中一个实施例中,所述针对所述第一初始参考值进行迭代,得到各个实体的第一参考值,包括:[0017] 按照公式 进行迭代,直至迭代的次数达到第一次数阈值,或者两次迭代得到的差值处于第一差值阈值内时,终止迭代,并将最后一次迭代得到的第一参考值作为对应实体的第一参考值;[0018] 其中,r(vi)表示节点vi在当前迭代下得到的第一参考值,n表示实体数据集中的节点总数,r(vj)表示节点vj的第一参考值;L(vj)表示节点vj的出链数,节点vj表示属于与节点vi存在关联关系的节点集合M(vi)中的节点;c表示关联概率。[0019] 在其中一个实施例中,所述方法还包括:获取所述实体数据集中每种实体类型的类型数量;[0020] 所述基于所述第一参考值从实体数据集中选取第一数量的实体作为参考节点,包括:基于所述类型数量确定每种实体类型的参考节点数量,使每种实体类型的参考节点数量之和为所述第一数量;基于属于相同实体类型中的实体的第一参考值选取出对应数量的节点作为所述参考节点。[0021] 在其中一个实施例中,所述实体数据集包括实体的实体规模数据、实体经营数据、实体类型和所述实体关联数据中的一种或多种数据类型。[0022] 在其中一个实施例中,所述基于属于相同实体类型中的实体的第一参考值选取出对应数量的节点作为所述参考节点,包括:针对所述每种数据类型计算出实体对应的数据量化值,所述实体关联数据的数据量化值包括所述第一参考值;获取每种数据类型对应的权值;根据所述权值和所述数据量化值计算出实体的综合量化值;根据所述综合量化值从每个实体类型中选取对应数量的节点作为所述参考节点。[0023] 在其中一个实施例中,所述基于所述第二初始参考值进行迭代,得到所述实体数据集中的每个实体节点的第二参考值,包括:[0024] 按照公式 进行迭代,直至迭代的次数达到第二次数阈值,或者两次迭代得到的差值处于第二差值阈值内时,终止迭代,并将最后一次迭代的输出值作为对应节点的第二参考值;[0025] 其中,ti表示第i次迭代的输出值,T表示实体节点中存在关联关系的概率的变换矩阵,d表示参考节点线性化后的值,具体为当前节点与其他节点形成随机模型的线性向量,a表示概率参考因子。[0026] 本申请第二方面,提供了一种实体数据可信校验装置,所述装置包括:[0027] 数据集获取模块,用于获取实体数据集;[0028] 有向链构建模块,用于基于所述实体数据集中的实体关联数据,构建实体节点有向链;[0029] 第一参考值计算模块,用于基于所述实体节点有向链计算出各个实体的第一参考值;[0030] 可信度确定模块,用于基于所述第一参考值从实体数据集中选取第一数量的实体作为参考节点;基于所述参考节点为实体节点设置第二初始参考值,基于所述第二初始参考值进行迭代,得到所述实体数据集中的每个实体节点的第二参考值;基于所述第二参考值确定出实体的可信度。[0031] 本申请第三方面,提供了一种计算机可读存储介质,所述计算机可读存储介质上存储有可执行指令,所述可执行指令被处理器执行时使所述处理器执行本申请任一项实施例所述的方法。[0032] 本申请第四方面,提供了一种电子设备,包括:一个或多个处理器;存储器,用于存储一个或多个程序,当所述一个或多个程序被所述一个或多个处理器执行时,使得所述一个或多个处理器执行本申请任一项实施例所述的方法。[0033] 本申请中的实体数据可信校验方法、装置、存储介质和电子设备,根据实体之间的关联数据来构建实体节点有向链,进而根据该实体节点有向链来确定出实体的第一参考值,通过该第一参考值来确定出参考节点,进而根据所选取的参考节点计算出可以体现出实体可信度的第二参考值。通过进行两次用来评价可信度的参考值的计算,由于第一参考值可以一定程度上体现出实体节点的优劣,本申请通过第一参考值来选取参考节点可以提高选取出来的参考节点的质量,进而提高了最终计算出来的第二参考值的准确性,从而提高了所确定的各个实体节点的可信度的准确性。附图说明[0034] 为了更清楚地说明本申请实施例的技术方案,下面将对实施例中所需要使用的附图作简单地介绍,应当理解,以下附图仅示出了本申请的某些实施例,因此不应被看作是对本申请范围的限定。[0035] 图1为一个实施例中实体数据可信校验方法的流程示意图;[0036] 图2为一个实施例中基于属于相同实体类型中的实体的第一参考值选取出对应数量的节点作为参考节点的流程示意图;[0037] 图3为一个实施例中各个节点的权值确定过程的流程示意图;[0038] 图4为一个实施例中实体数据可信校验装置的结构框图;[0039] 图5为另一个实施例中实体数据可信校验装置的结构框图。具体实施方式[0040] 为了使本申请的目的、技术方案及优点更加清楚明白,以下结合附图及实施例,对本申请进行进一步详细说明。应当理解,此处所描述的具体实施例仅仅用以解释本申请,并不用于限定本申请。[0041] 本申请所使用的所有术语(包括技术和科学术语)具有本领域技术人员通常所理解的含义,除非另外定义。应注意,这里使用的术语应解释为具有与本说明书的上下文相一致的含义,而不应以理想化或过于刻板的方式来解释。[0042] 比如本申请所使用的术语“第一”、“第二”等可在本文中用于描述各种元件,但这些元件不受这些术语限制。这些术语仅用于将第一个元件与另一个元件区分。[0043] 再比如本申请所使用的术语“包括”、“包含”等表明了特征、步骤、操作和/或部件的存在,但是并不排除存在或添加一个或多个其他特征、步骤、操作或部件。[0044] 在一个实施例中,如图1所示,提供了一种实体数据可信校验方法,该方法包括:[0045] 步骤102,获取实体数据集。[0046] 本实施例中,实体数据集为多个实体的相关数据的集合。其中,实体可为上述的企业、组织、个人,也可为具体的实体产品。每个实体的相关数据可包括实体基本数据、实体规模数据、实体经营数据、实体类型和实体关联数据等其中的一种或多种数据类型。[0047] 其中,电子设备可以访问相关平台或数据库,在其中查找或抓取各个实体的数据,并对该实体数据进行处理,形成该实体数据集。其中,实体基本数据包括实体的名称、地址、日期等基础信息;实体规模数据包括实体的人员规模、经济规模等其中的一种或多种规模数据;实体经营数据包括实体的经营类别、市场份额、成本、利润等其中的一种或多种体现经营方面的数据;实体数据类型表示实体的类型;实体关联数据表示实体之间存在的关联关系的数据。[0048] 以实体为企业实体,该基本数据可包括公司名称、注册地址、成立日期、法定代表人等其中的一种或多种;规模数据可包括员工人数、注册资本、总资产、市场份额等其中的一种或多种;经营数据可能包括销售收入、净利润、成本结构、市场份额变动、客户增长率等其中的一种或多种;企业的实体类型可能属于“科技公司”、“制造业公司”、“金融公司”等类型;实体关联数据可包括与其他企业的合作关系(如供应商、客户、竞争对手)、投资关系(如股东、被投资公司)等。[0049] 当实体为产品实体,其基本数据可包括产品名称、型号、制造商、生产日期等基本信息;当实体为城市实体,其规模数据可能包括人口数量、面积、GDP等体现出城市规模的相关数据;当实体为电商店铺实体,其经营数据可包括订单量、销售额、退货率、客户满意度等其中的一种或多种;当实体为产品实体时,其实体类型可为属于“电子产品”、“食品”、“服装”等类型;当实体为个人用户时,实体关联数据可包括用户之间的好友关系、关注关系、互动记录等体现出用户之间的关联互动的数据。[0050] 电子设备通过获取多个实体的相关数据,用于为后续的实体可信校验进行分析。当实体具体为企业时,本申请提出的实体数据可信校验方法具体为企业信任评价方法。[0051] 步骤104,基于实体数据集中的实体关联数据,构建实体节点有向链。[0052] 本实施例中,以实体为企业为例进行说明,实体关联数据可以表示为企业与企业之间的关联关系数据,该关联关系数据具体可包括投资关系、合作关系等。其中,企业之间的关联关系可包括企业股东、董事会成员、监事、高管等成员向其他企业的投资的关系。当存在这一关联关系时,可以基于该关联关系形成企业之间的有向链。[0053] 一个企业对另一家企业的一次投资等关联数据可以看成是一次投票,基于企业之间的投票可以将整个企业关系网视为一个巨大的有向图。举例来说,将各个企业当做一个节点,而一家企业对另一家企业投资则是一个节点指向另一个节点的有向边,该关联关系将两个节点之间构建形成了一个有向链。比如当存在企业q的高管对另一家企业p存在投资关系时,则可以形成节点有向链。所有的节点之间形成的有向链可以构建出整个企业关系网的有向图。[0054] 步骤106,基于实体节点有向链计算出各个实体的第一参考值。[0055] 第一参考值可以用来对实体的可信度提供参考,通常而言,实体之间的关联数据越多,其第一参考值越大,对应实体的可信度也越大,但也存在一些例外。[0056] 具体的,实体节点有向链反映了两个节点之间的关联关系由于在实体数据集中,可能存在部分实体与其他任何实体之间均不具备关联数据,即该实体为孤立实体节点。针对孤立实体节点进一步进行虚拟处理,将孤立节点添加指向其他所有节点的实体节点有向链,并设置每个实体节点以关联概率c对外进行关联。以实体节点为企业为例,该关联可以表示为实体节点对外进行投资。其中,该关联概率c可为预设的处于0‑1范围内的任意合适的数值。[0057] 可选地,通常而言,大部分实体节点的第一参考值与该节点对应的有向链呈正相关。以节点为企业进行说明,通常当企业向外投资越多,则对应的第一参考值越大。[0058] 在一个实施例中,步骤106包括:根据实体节点有向链确定各个节点的出链数和入链数;根据出链数和入链数以及预设的关联概率计算出各个实体的第一参考值。[0059] 本实施例中,出链表示节点A主动与节点B产生关联关系时,比如企业A向企业B存在投资入股的关联关系,即表示节点A主动与节点B产生关联关系。该关联关系表示节点A出链,节点B入链,电子设备统计所有具有实际关联关系的节点,并基于该关联关系确定出每个节点对应的出链数和入链数。其中,出链数和入链数可为统一固定的数值,比如当节点A相对于节点B存在入链时,则可以设置其对应的入链数为1,当节点A相对于节点C存在出链时,同样可以设置其对应的入链数为1。进一步地,该出链数和入链数可以根据节点之间存在关联关系的数量来确定,存在关联关系的数量越多,其对应的出链数和/或入链数越大或越小。比如节点A相对于节点B存在表示第一数量的入链的关联关系,且节点C相对于节点D存在表示第二数量的入链的关联关系,若第一数量大于第二数量,则该节点A对应的入链数大于节点B对应的入链数。类似地,节点A相对于节点B存在表示第三数量的出链的关联关系,且节点C相对于节点D存在表示第四数量的出链的关联关系,若第三数量大于第四数量,则该节点A对应的出链数大于节点B对应的出链数。[0060] 在确定了各个节点之间的入链数、出链数之后,即可根据该入链数、出链数以及对应的关联概率c计算出相应的第一参考值。[0061] 在一个实施例中,根据出链数和入链数以及预设的关联概率计算出各个实体的第一初始参考值;针对第一初始参考值进行迭代,得到各个实体的第一参考值。[0062] 第一参考值可为基于PageRank算法、BadRank算法、HITS算法、TrustRank算法等其中的一种或多种的组合而计算出来的数值。可选地,以基于PageRank算法计算出第一参考值为例,可以按照如下公式(1)进行迭代,从而计算出各个实体的第一参考值。[0063] 公式(1)[0064] 其中,r(vi)表示节点vi在当前迭代下得到的第一参考值,所有节点形成的第一参考值即组成了向量R;n表示实体数据集中的节点总数,r(vj)表示节点vj的第一参考值;L(vj)表示节点vj的出链数,节点vj表示属于与节点 存在关联关系的节点集合M(vi)中的节点;c表示关联概率,比如可以设置c为0.85。[0065] 针对该公式,在计算整个节点的第一参考值R时,首先进行初次迭代(t=1)时,可将上述各个节点对应的出链数和入链数导入该公式中进行计算,得到第一次迭代下的第一参考值R1,再进行第二次迭代时,使t=t+1,并继续利用该公式进行迭代计算,比较前后两次迭代得到的R值的差值。[0066] 可选地,电子设备可以预先设置相应的第一次数阈值,当迭代次数达到了该第一次数阈值时,终止迭代,将最后一次迭代得到的各个节点的第一参考值作为对应实体的第一参考值。[0067] 或者,电子设备还可以进一步设置相应的第一差值阈值,当各个节点对应的R值的差值均小于第一差值阈值时,表示各个节点的第一参考值收敛,同样终止迭代,将最后一次迭代所得到的第一参考值作为对应实体的第一参考值。[0068] 其中,该第一次数阈值和第一差值阈值可为预先设定的任意合适的数值,比如该第一次数阈值可为30或其它任意合适的数值。[0069] 步骤108,基于第一参考值从实体数据集中选取第一数量的实体作为参考节点。[0070] 本实施例中,所计算出来的第一参考值可以一定程度上反映出对应实体的可信度,大部分实体的可信度与其第一参考值正相关。电子可以基于计算出来的各个实体的第一参考值,从其中选取出第一数量的实体作为用来计算各个实体的第二参考值的参考节点。[0071] 其中,第一数量x0小于实体数据集中的节点总数n,x0可为预先设置的任意合适的数量,比如为200、300等数值。进一步的,该数量可为根据实体数据集中所包含的实体的数量来确定,比如可以设置前1%的实体的数量作为该第一数量。[0072] 可选地,参考节点可包括可信参考节点和垃圾参考节点。其中,可信参考节点的第一参考值相对高于垃圾参考节点的第一参考值。电子设备可以仅选取第一数量的可信参考节点来作为参考节点,比如可以选择第一参考值最高的第一数量的实体种子来作为参考节点。[0073] 在一个实施例中,也可以选择第二数量的可信参考节点,以及第三数量的垃圾参考节点来作为参考节点。其中第三数量与第二数量之和即为该第一数量。比如可以选择第一参考值最高的第二数量的实体种子来作为可信参考节点,并选取第一参考值最低的第三数量的实体种子来作为垃圾参考节点。[0074] 在一个实施例中,电子设备还可以根据第一参考值选择出预设数量的实体节点出来,针对所选取的实体节点进行人工校验,从而去除质量不高的实体节点,经过人工校验之后得到该第一数量的参考节点。比如经过人工校验之后,得到第二数量的可信参考节点以及第三数量的垃圾参考节点。[0075] 由于参考节点的选取对第二参考值的计算具有较大的影响,通过择第一参考值来进行参考节点的选取,可以提高筛选出来的参考节点质量,且进一步通过既筛选可信参考节点,又筛选垃圾参考节点,还可以进一步提高参考节点选取的全面性。[0076] 步骤110,为每个参考节点设置第二初始参考值,基于第二初始参考值进行迭代,得到实体数据集中的每个实体节点的第二参考值。[0077] 本实施例中,针对选取出来的参考节点来设置各个实体节点的第二初始参考值。举例来说,针对可信参考节点,将其设置的第二初始参考值可均为1;针对垃圾可信参考节点,将其设置的第二初始参考值可均为‑1,针对其他未选中的实体节点,将其第二初始参考值设置为0。[0078] 当所选取的所有参考节点均为可信参考节点时,将参考节点的第二初始参考值均设置为1,其余实体节点的第二初始参考值均设置为0。[0079] 通过既选取可信参考节点赋予正值(信任值),又选取垃圾参考节点赋予负值(非信任值),提高了参考节点选取的全面性,可以使得在迭代过程中会抑制信任值对可信度不高的实体节点的传播,同时抑制非信任值对可信度较高的实体节点终端的传播,提高了输出的第二参考值的准确性。[0080] 其中,在确定了各个实体节点的第二初始参考值之后,可按照预设的迭代模型进行迭代,从而输出第二参考值。[0081] 具体地,当模型的迭代次数达到预设的第二次数阈值,或者两次迭代得到的差值处于第二差值阈值内时,则终止迭代,并将最后一次迭代的输出值作为对应节点的第二参考值。[0082] 当前后两次迭代输出的各个节点对应的差值均小于第二差值阈值时,表示各个节点的第二参考值收敛,则可以终止迭代。[0083] 类似地,第二次数阈值和第二差值阈值可为预先设定的任意合适的数值,比如该第二次数阈值可为50或其它任意合适的数值。[0084] 在一个实施例中,第二参考值t的计算可以按照TrustRank算法来计算,比如可按照如下公式(2)来进行TrustRank值迭代计算:[0085] 公式(2)[0086] 其中,ti表示第i次迭代的输出值,T表示实体节点中存在关联关系的概率的变换矩阵,d表示参考节点线性化后的值,具体为当前节点与其他节点形成随机模型的线性向量,a表示概率参考因子,其数值范围处于0‑1之内。[0087] 可选地,该变换矩阵可为根据各个节点的出链数和/或入链数而确定的矩阵,也可以称之为转移矩阵。该概率参考因子可为预设的固定值,比如可设置处于0‑1范围内的任意合适的数值,比如可设置为0.85,也可以为根据各个节点的第一参考值而确定的数值。当为根据各个节点的第一参考值所设定的数值时,可为处于一个预设范围内的数值。[0088] 优选地,该变换矩阵T可按照T=bA+(1‑b)B来确定。[0089] 其中, ,表示正向变换矩阵, 表示逆向变换矩阵。r(q)表示节点q的入链数;L(p)表示节点p的出链数;M表示存在关联关系节点的集合;b表示关联概率,可为处于0‑1范围内的任意合适的数值。通过根据出链数和入链数来进一步确定变换矩阵,使得计算得到的第二参考值更加精准。[0090] 更优选的,上述的概率参考因子a可为根据各个节点的第一参考值所确定的向量,其中的每个向量元素即表示对应的节点的概率参考因子。可选地,实体节点i的概率参考因子可以表示为 ,其中,k0和k均为预设的固定系数,比如k0和k均可以取0.5,或者k0可以取0.8,k可以取0.1;rmax表示实体集合中第一参考值的最大值,r(i)表示实体节点i的第一参考值,该第一参考值可为通过上述的PageRank算法计算得到的数值。ai的数值处于0‑1的范围内。[0091] 通过设置概率参考因子的数值与各个节点的第一参考值相关,使得各个节点的概率参考因子并非固定值,且可以得到更加精准的第二参考值。[0092] 本申请通过针对变换矩阵T和概率参考因子a进行优化,相比于优化前的变换矩阵T和概率参考因子a所计算来的第二参考值更能体现出实体节点的可信度。[0093] 步骤112,基于第二参考值确定出实体的可信度。[0094] 本实施例中,在计算出各个节点的第二参考值之后,可针对所计算出来的第二参考值进行归一化处理,将归一化处理之后的数值作为实体的可信度。其中,第二参考值与可信度正相关,第二参考值越大,其可信度越大。或者还可以直接将该第二参考值作为实体的可信度。[0095] 本申请中的实体数据可信校验方法,根据实体之间的关联数据来构建实体节点有向链,进而根据该实体节点有向链来确定出实体的第一参考值,通过该第一参考值来确定出参考节点,进而根据所选取的参考节点计算出可以体现出实体可信度的第二参考值。通过进行两次用来评价可信度的参考值的计算,由于第一参考值可以一定程度上体现出实体节点的优劣,本申请通过第一参考值来选取参考节点可以提高选取出来的参考节点的质量,进而提高了最终计算出来的第二参考值的准确性,从而提高了所确定的各个实体节点的可信度的准确性。[0096] 在一个实施例中,基于第一参考值从实体数据集中选取第一数量的实体作为参考节点,包括:基于类型数量确定每种实体类型的参考节点数量,使每种实体类型的参考节点数量之和为第一数量;基于属于相同实体类型中的实体的第一参考值选取出对应数量的节点作为参考节点。[0097] 本实施例中,由于实体节点存在多种实体类型,以企业为例,企业的类型可包括“科技公司”、“制造业公司”、“金融公司”等类型,或者还可以进行进一步细分。可选地,针对每种类型的实体,可以选取对应数量的种子,使地种子的选取更加全面。[0098] 具体的,针对第i类实体,确定需要选取的种子数量为xi,则 。其中,u表示实体类型总数,x0即为第一数量。[0099] 在一个实施例中,针对第i类实体,根据第一参考值,所选取的参考节点中可以既包括可信参考节点还包括垃圾参考节点。其中,第i类实体的可信参考节点的选取数量可为xi_1,垃圾参考节点的选取数量可为xi_2,xi_1+xi_2=xi。其中,xi_1与xi_2可为相同的数值,即垃圾参考节点和可信参考节点的数量相同。其中,可以按照从大到小的顺序,选取排名在第1至第xi_1位的第一参考值对应节点作为可信参考节点,选取排名在最后xi_2位的第一参考值对应节点作为垃圾参考节点。[0100] 在一个实施例中,参考节点的选取除了考虑实体关联数据这一数据类型所计算出来的第一参考值之外,还进一步考虑实体数据集中的其他数据类型来作为参考,通过从各个维度的数据综合确定参考节点,包括确定可信参考节点以及垃圾参考节点。[0101] 其中,该数据类型除了包括实体关联数据之外,还可包括实体的实体规模数据、实体经营数据、实体类型等其中的一种或多种。[0102] 电子设备可针对实体的每种数据类型,计算出对应类型的数据量化值,进而根据一个或多个维度的数据量化值进行加权求和,得到实体的综合量化值,基于该综合量化值确定出参考节点。其中,实体关联数据的数据量化值即为上述的第一参考值。各个数据类型的权值可为预先设定的权值,还可以为通过算法进行迭代优化而确定出来的权值,使得所计算出来的权值更加能够体现出对应类型的贡献度。[0103] 在一个实施例中,如图2所示,基于属于相同实体类型中的实体的第一参考值选取出对应数量的节点作为参考节点,包括:[0104] 步骤202,针对每种数据类型计算出实体对应的数据量化值,实体关联数据的数据量化值包括第一参考值。[0105] 本申请中,以实体为企业为例进行说明,该数据类型具体可包括企业规模数据、企业经营数据、企业类型和企业关联数据。该企业规模数据可为上述的人员规模、经济规模等相关数据,比如包括企业员工人数,企业注册资本等;企业经营数据可包括企业的市场份额、营收、利润等数据。[0106] 针对各个类型的数据进行量化,比如针对某个实体i,其第j类数据的数据量化值为Bij,以实体的数据类型分别包括实体规模数据、实体经营数据、实体类型和实体关联数据等4类为例进行说明,则实体i形成的数据量化值为[Bi1,Bi2,Bi3,Bi4]。其中,该Bi1为实体规模数据对应的数据量化值,Bi2为实体经营数据对应的数据量化值;Bi3为实体类型对应的数据量化值;Bi4为实体关联数据对应的数据量化值,即该第一参考值。可选地,所形成的数据量化值可为均处于0‑1范围内。[0107] 步骤204,获取每种数据类型对应的权值。[0108] 其中,各实体对应的第j类数据的权值为wj,所有类型的权值之和为1。[0109] 步骤206,根据权值和数据量化值计算出实体的综合量化值。[0110] 可选地,针对每个节点,可将其在各个类型下的数据量化值与其权值相乘,并求和,将其得到的数值即作为其综合量化值。即节点i的综合量化值 。其中,u表示实体数据集中的数据类型数量。[0111] 步骤208,根据综合量化值从每个实体类型中选取对应数量的节点作为参考节点。[0112] 在得到综合量化值之后,可针对每个实体类型,选取出对应的数量的节点作为参考节点。其中,所选取的参考节点中可以既包括可信参考节点还包括垃圾参考节点。比如第i类实体的可信参考节点的选取数量可为xi_1,垃圾参考节点的选取数量可为xi_2,xi_1+xi_2=xi。可以按照综合量化值从大到小的顺序,选取排名在第1至第xi_1位的综合量化值对应节点作为可信参考节点,选取排名在最后xi_2位的综合量化值对应节点作为垃圾参考节点。[0113] 在一个实施例中,如图3所示,各个节点的权值确定过程包括:[0114] 步骤302,针对数据类型构建判断矩阵G。[0115] 本实施例中,该判断矩阵G中的元素gij表示的是第i种数据类型相对于第j种数据类型的优先度,gij为预先设置的大于0的合适数值,且 。其中,数值为1则表示两者优先度相同;大于1且越大,则说明第i种数据类型相对于第j种数据类型的优先度越高;小于1且越小,则说明第i种数据类型相对于第j种数据类型的优先度越低。[0116] 步骤304,对判断矩阵G进行归一化处理,形成归一化矩阵H。[0117] 本实施例中,对矩阵G进行归一化处理后,使得形成的归一化矩阵H中的每列元素之和为1。[0118] 步骤306,计算满足HW=λmaxW的归一化矩阵的特征根λ和特征向量W。[0119] 其中,λmax为归一化矩阵H的最大特征根。[0120] 步骤308,针对计算出来的最大特征根λmax进行一致性校验。当一致性校验通过时,进入步骤310。当一致性校验不通过时,返回并重新执行针对各个数据类型构建判断矩阵A,直至计算出来的最大特征根λmax通过一致性校验。[0121] 步骤310,基于所计算出来的特征向量W确定各个数据类型的权值。[0122] 具体的,一致性校验可按照公式CR=CI/RI来计算,其中,CI=(λmax‑m)/(m‑1),CI表示一致性比例,RI为平均随机一致性指标,其数值可根据查表得到,比如可查表将m对应的数值作为RI的值。m为数据类型的数量,其为矩阵G、H的阶数。[0123] 电子设备可检测计算出来的CI值是否小于一致性阈值,若小于,则说明一致性校验通过,若不小于,则判定不通过。当不通过时,则返回到步骤202中,对所配置的gij进行重新调整,直至计算出来的CI值一致性校验通过。[0124] 在通过了一致性校验之后,可以将计算出来的特征向量W直接作为数据类型对应的权值,或者将该特征向量W进行归一化,将形成的归一化之后的特征向量作为数据类型的权值。比如可以将形成的特征向量W中的元素wi表示第i种数据类型对应的权值。[0125] 本实施例中,通过上述方法,可以合理地设置各种数据类型的权值,从而进一步提高了对数据类型的权值设置的合理性。[0126] 在一个实施例中,如图4所示,提供了一种实体数据可信校验装置,装置包括:[0127] 数据集获取模块402,用于获取实体数据集。[0128] 有向链构建模块404,用于基于实体数据集中的实体关联数据,构建实体节点有向链。[0129] 第一参考值计算模块406,用于基于实体节点有向链计算出各个实体的第一参考值。[0130] 可信度确定模块408,用于基于第一参考值从实体数据集中选取第一数量的实体作为参考节点;基于参考节点为实体节点设置第二初始参考值,基于第二初始参考值进行迭代,得到实体数据集中的每个实体节点的第二参考值;基于第二参考值确定出实体的可信度。[0131] 在一个实施例中,第一参考值计算模块406还用于根据实体节点有向链确定各个节点的出链数和入链数;根据出链数和入链数以及预设的关联概率计算出各个实体的第一参考值。[0132] 在一个实施例中,第一参考值计算模块406还用于根据出链数和入链数以及预设的关联概率计算出各个实体的第一初始参考值;针对第一初始参考值进行迭代,得到各个实体的第一参考值。[0133] 在一个实施例中,第一参考值计算模块406还用于按照公式进行迭代,直至迭代的次数达到第一次数阈值,或者两次迭代得到的差值处于第一差值阈值内时,终止迭代,并将最后一次迭代得到的第一参考值作为对应实体的第一参考值。[0134] 在一个实施例中,数据集获取模块402还用于获取实体数据集中每种实体类型的类型数量。[0135] 可信度确定模块408还用于基于类型数量确定每种实体类型的参考节点数量,使每种实体类型的参考节点数量之和为第一数量;基于属于相同实体类型中的实体的第一参考值选取出对应数量的节点作为参考节点。[0136] 在一个实施例中,实体数据集包括实体的实体规模数据、实体经营数据、实体类型和实体关联数据中的一种或多种数据类型。[0137] 可信度确定模块408还用于针对每种数据类型计算出实体对应的数据量化值,实体关联数据的数据量化值包括第一参考值;获取每种数据类型对应的权值;根据权值和数据量化值计算出实体的综合量化值;根据综合量化值从每个实体类型中选取对应数量的节点作为参考节点。[0138] 在一个实施例中,可信度确定模块408还用于按照公式进行迭代,直至迭代的次数达到第二次数阈值,或者两次迭代得到的差值处于第二差值阈值内时,终止迭代,并将最后一次迭代的输出值作为对应节点的第二参考值。[0139] 在一个实施例中,如图5所示,实体数据可信校验装置还包括权值计算模块401,用于针对数据类型构建判断矩阵G;对判断矩阵G进行归一化处理,形成归一化矩阵H;计算满足HW=λmaxW的归一化矩阵的特征根λ和特征向量W;针对计算出来的最大特征根λmax进行一致性校验;当一致性校验通过时,基于所计算出来的特征向量W确定各个数据类型的权值,当一致性校验不通过时,返回并重新执行针对各个数据类型构建判断矩阵A,直至计算出来的最大特征根λmax通过一致性校验。[0140] 在一个实施例中,提供了一种计算机可读存储介质,其上存储有可执行指令,该指令被处理器执行时使处理器执行上述各方法实施例中的步骤。[0141] 在一个实施例中,还提供了一种电子设备,包括一个或多个处理器;存储器,存储器中存储有一个或多个程序,其中,当一个或多个程序被一个或多个处理器执行时,使得一个或多个处理器执行上述各方法实施例中的步骤。[0142] 最后应说明的是:以上各实施例仅用以说明本申请的技术方案,而非对其限制;尽管参照前述各实施例对本申请进行了详细的说明,本领域的普通技术人员应当理解:其依然可以对前述各实施例所记载的技术方案进行修改,或者对其中部分或者全部技术特征进行等同替换;而这些修改或者替换,并不使相应技术方案的本质脱离本申请各实施例技术方案的范围。[0143] 此外,本领域的技术人员能够理解,尽管在此的一些实施例包括其它实施例中所包括的某些特征而不是其它特征,但是不同实施例的特征的组合意味着处于本申请的范围之内并且形成不同的实施例。例如,在上面的权利要求书中,所要求保护的实施例的任意之一都可以以任意的组合方式来使用。公开于该背景技术部分的信息仅仅旨在加深对本申请的总体背景技术的理解,而不应当被视为承认或以任何形式暗示该信息构成已为本领域技术人员所公知的现有技术。

专利地区:辽宁

专利申请日期:2024-07-10

专利公开日期:2024-10-29

专利公告号:CN118468354B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
搜索
搜本页
欢迎咨询

扫码可加微信,手机访问拨打咨询

欢迎咨询

欢迎咨询
数据加载中...