本平台为商业科创服务平台 非政府政务服务网站

面向AI算力服务器的多维度性能评估方法及服务器终端

更新时间:2026-10-01
面向AI算力服务器的多维度性能评估方法及服务器终端 专利申请类型:发明专利;
地区:山东-菏泽;
源自:菏泽高价值专利检索信息库;

专利名称:面向AI算力服务器的多维度性能评估方法及服务器终端

专利类型:发明专利

专利申请号:CN202411095489.5

专利申请(专利权)人:大唐智创(山东)科技有限公司
权利人地址:山东省菏泽市开发区洞庭路1788号(新世纪科技城南)

专利发明(设计)人:韩伟昌,朱泳霖,郭岩

专利摘要:本发明涉及AI算力服务器性能评估的技术领域,公开了面向AI算力服务器的多维度性能评估方法及服务器终端,包括采集AI算力服务器的风扇转速和服务器终端温度以及服务器内存利用率,对采集的数据进行数据预处理,将预处理后的数据输入到数据分析的输入层,通过对输入层处理后的数据进行分析,进而监测AI算力服务器的实时运行状态,并对AI算力服务器的运行情况进行分析,然后通过误差项反向传播AI算力服务器监测模型,对AI算力服务器运行进行调控,同时也对AI算力服务器终端运行进行调控,最终进行展示,实现了AI算力服务器的多维度性能评估调控。

主权利要求:
1.面向AI算力服务器的多维度性能评估方法,其特征在于,包括:S1、采集AI算力服务器的初始数据,所述初始数据为风扇转速、服务器终端温度和服务器内存利用率;
S2、对初始数据进行数据预处理,获取时间序列集合,所述时间序列集合包括时序数据,将时序数据输入到用于数据分析的输入层;
所述对初始数据进行数据预处理为去除冗余和错误的数据;
输入层作为数据分析的输入端口,用于接收预处理后的服务器内存利用率数据、风扇转速数据和服务器终端温度数据;
所述输入层将输入的预处理后初始数据进行相关性处理,获取时间序列集合,将预处理后的初始数据转化为时序数据,所述时间序列集合的计算表达式如下所示:;
其中,X为时间序列集合, 为输入的第n个时序数据,n取1,2,3,……;
所述时序数据包括服务器内存利用率数据、风扇转速数据和服务器终端温度数据,计算表达式如下所示:;
其中, 为第n组服务器内存利用率数据, 为第n组风扇转速数据, 为第n组服务器终端温度数据;
S3、通过输入层对时序数据进行整合,得到AI算力服务器的服务器内存利用率数据、风扇转速数据和服务器终端温度数据的特征值,进而监测AI算力服务器的实时运行状态;
S4、通过AI算力服务器监测模型监测风扇转速、服务器终端温度和服务器内存利用率,进而对AI算力服务器的实时运行状态进行分析,进而得出AI算力服务器的异构计算性能、能效性能和安全性能;
对时间序列集合进行权重分析,并得出当前时刻输入向量权重和上一时刻输出向量的权重,通过建立AI算力服务器监测模型,对服务器内存利用率数据、风扇转速数据和服务器终端温度数据进行实时监测,AI算力服务器监测模型计算表达式如下所示:;
其中, 为AI算力服务器监测模型的输出, 为当前时刻输入的时间序列集合的权重,为当前时刻输入的时间序列集合, 为上一刻输入的时间序列集合的权重, 为上一时刻输入的时间序列集合;
令 为在t时刻的加权输入,则计算表达式如下所示:
;
其中, 为加权输入;
S5、通过误差项反向传播AI算力服务器监测模型,进而对AI算力服务器运行进行调控,同时也对AI算力服务器终端运行进行调控;
通过计算AI算力服务器监测模型在t时刻的误差项,进而得出所述AI算力服务器的异构计算性能、能效性能和安全性能,计算表达式如下所示:;
其中,为误差项, 为函数求偏导符号;
误差项根据AI算力服务器预设阈值和实际时序数据的误差值,反映出内存利用率数据映射出的异构计算性能、风扇转速数据映射出的能效性能和服务器终端温度数据映射出的安全性能;
S6、若AI算力服务器及AI算力服务器终端自动控制异常和超出预设阈值,则对AI算力服务器及AI算力服务器终端进行预警,获取预警数据;
S7、通过可视化屏幕对AI算力服务器监测模型监测和自动调控以及预警数据进行展示。
2.根据权利要求1所述的面向AI算力服务器的多维度性能评估方法,其特征在于:所述服务器内存利用率、风扇转速和服务器终端温度均为确定需要监控的性能指标;
通过传感器、监控软件和数据采集工具对服务器内存利用率、风扇转速和服务器终端温度的数据进行采集;
建立一个中央数据库用于存储和管理采集到的服务器内存利用率、风扇转速和服务器终端温度的数据。
3.根据权利要求2所述的面向AI算力服务器的多维度性能评估方法,其特征在于:所述预设阈值包括预设性能阈值、预设转速阈值和预设温度阈值;
若异构计算性能小于预设性能阈值,则AI算力服务器内存未满,异构计算性能可延展,若异构计算性能大于预设性能阈值,则AI算力服务器内存已满,异构计算性能不可延展,对AI算力服务器进行缓存清理;
通过风扇转速进而对AI算力服务器能效性能进行判断,若风扇转速达到预设转速阈值,对AI算力服务器进行释压处理,若风扇转速未达到预设转速阈值,则不对AI算力服务器进行控制;
通过服务器终端温度数据进行对AI算力服务器终端的安全性进行判断,若温度未达到预设温度阈值,则AI算力服务器终端正常运行,若温度超过预设温度阈值,则AI算力服务器终端过载运行,需要进行调控。
4.根据权利要求3所述的面向AI算力服务器的多维度性能评估方法,其特征在于,所述通过误差项反向传播AI算力服务器监测模型,进而对AI算力服务器运行进行调控,同时也对AI算力服务器终端运行进行调控,包括:通过反向传播函数将误差项输出给AI算力服务器监测模型进而对AI算力服务器及AI算力服务器终端进行优化,计算表达式如下所示:;
其中, 为校正值,T为矩阵转置,diag[]为构造对角矩阵函数;
所述校正值通过前一时刻的误差项和初始误差项,进而优化任意时刻的AI算力服务器及AI算力服务器终端。
5.根据权利要求4所述的面向AI算力服务器的多维度性能评估方法,其特征在于:对所述对AI算力服务器及AI算力服务器终端进行预警,及时发现AI算力服务器的性能异常或故障情况,并向管理员发送警报信息,同时设置阈值规则,当性能指标不符合阈值规则时,触发告警和应急处理流程;
将历史数据进行存储,对AI算力服务器监测模型进行优化和升级。
6.面向AI算力服务器的多维度性能评估服务器终端,用于实现权利要求1‑5中任一项所述的面向AI算力服务器的多维度性能评估方法,其特征在于,包括:数据采集模块,用于采集AI算力服务器的初始数据,所述初始数据为风扇转速、服务器终端温度和服务器内存利用率;
数据处理与分析模块,包括用于对初始数据进行预处理的数据处理单元,用于对预处理后的初始数据进行特征分析和计算权重的输入层,用于对AI算力服务器及AI算力服务器终端进行参数监测的AI算力服务器监测模型;
多维度性能评估模块,包括用于反馈AI算力服务器监测模型在t时刻的误差项的反馈单元,用于接收误差项并对AI算力服务器和AI算力服务器终端性能参数进行调整控制的性能评估单元;
可视化模块,用于展示AI算力服务器性能情况、AI算力服务器终端性能情况;
告警和监控模块,用于预警AI算力服务器及AI算力服务器终端异常情况。
7.一种电子设备,其特征在于,包括:
存储器,用于存储指令;
处理器,用于执行所述指令,使得所述设备执行实现如权利要求1‑5中任一项所述的面向AI算力服务器的多维度性能评估方法。
8.一种计算机可读存储介质,其上存储有计算机程序,其特征在于:该计算机程序被执行时,实现如权利要求1‑5中任一项所述的面向AI算力服务器的多维度性能评估方法。 说明书 : 面向AI算力服务器的多维度性能评估方法及服务器终端技术领域[0001] 本发明涉及AI算力服务器性能评估的技术领域,公开了面向AI算力服务器的多维度性能评估方法及服务器终端。背景技术[0002] 随着人工智能技术的快速发展,AI算力服务器的硬件配置也在不断提升。处理器方面,GPU(图形处理器)仍然是主流选择,但也出现了专门为AI设计的加速器,能够显著加速深度学习任务的执行AI算力服务器对存储容量和速度的需求也在增加,同时,高速内存(如DDR4和HBM)的应用也在提高服务器的数据处理能力,与此同时,AI算力服务器的多维度性能评估方法也是多方面的,其中包括:计算性能评估、存储性能评估、评估服务器之间的通信性能,包括带宽、时延和吞吐量等。常用的指标包括Gb/s(每秒传输的数据量)和ms(网络延迟)、评估服务器在相同工作量下的能源消耗情况,以及能耗和性能之间的平衡。常用的指标包括功耗、功耗效率和能效比等。[0003] 但是目前,随着人工智能的快速发展,AI算力服务器也有很多不足之处,例如AI算力服务器的建设和维护成本较高,尤其是对于小规模企业或个人用户而言,往往难以承担、AI算力服务器的高计算能力和存储需求导致较高的能源消耗,对能源资源造成一定压力,并且需要解决能效问题以降低能源消耗、高性能的AI算力服务器产生大量热量,需要有效的散热系统来保持稳定运行,并进行故障预防和及时修复、由于AI算力服务器处理的是大量敏感数据,对数据安全和隐私保护提出了更高的要求,需要加强数据加密、访问控制和隐私保护措施。[0004] 例如现有的公开号为CN116382843A的专利,公开了一种基于Kubernetes容器技术的工业AI算力PaaS平台,包括:基础设施层,用于提供云服务器、网络资源和系统支持;平台层,包括用于进行技术运营、数据运营、内容运营和业务运营的业务中台,以及用于数据源采集、数据存储、数据计算并基于Harbor私有镜像仓库对镜像资源进行管理的数据中台;服务层,包括AI数据服务和云服务SDK。该发明可面向用户提供应用服务、AI训练、AI在线服务、训练模型管理、训练环境管理、资源管理等功能和服务,实现流程工业生产过程一站式AI算法算力任务托管;实现了云资源精准化管理,可以根据不同生产过程设计的AI算法模型进行持续集成和持续部署,训练服务基于Docker镜像及容器技术封装训练算法。[0005] 上述专利无法全方位的了解算力服务器的性能,无法尽可能多的收集数据,并通过挖掘数据特征,找出服务器潜在问题,未集成人工智能算法和算法集群对服务器进行实时监测。发明内容[0006] 为解决上述技术问题,本发明的主要目的在于提供面向AI算力服务器的多维度性能评估方法,包括:[0007] S1、采集AI算力服务器的初始数据,所述初始数据为风扇转速和服务器终端温度和服务器内存利用率;[0008] S2、对初始数据进行数据预处理,获取时间序列集合,所述时间序列集合包括时序数据,将时序数据输入到用于数据分析的输入层;[0009] 所述对初始数据进行数据预处理为去除冗余和错误的数据;[0010] 输入层作为数据分析的输入端口,用于接收预处理后的服务器内存利用率数据、风扇转速数据和服务器终端温度数据;[0011] 所述输入层将输入的预处理后初始数据进行相关性处理,获取时间序列集合,将预处理后的初始数据转化为时序数据,所述时间序列集合的计算表达式如下所示:[0012] ;[0013] 其中,X为时间序列集合, 为输入的第n个时序数据,n取1,2,3,……;[0014] 所述时序数据包括服务器内存利用率数据、风扇转速数据和服务器终端温度数据,计算表达式如下所示:[0015] ;[0016] 其中, 为第n组服务器内存利用率数据, 为第n组风扇转速数据, 为第n组服务器终端温度数据;[0017] S3、通过输入层对时序数据进行整合,得到AI算力服务器的服务器内存利用率数据、风扇转速数据和服务器终端温度数据的特征值,进而监测AI算力服务器的实时运行状态;[0018] S4、通过AI算力服务器监测模型监测风扇转速、服务器终端温度和服务器内存利用率,进而对AI算力服务器的实时运行状态进行分析,进而得出AI算力服务器的异构计算性能、能效性能和安全性能;[0019] 对时间序列集合进行权重分析,并得出当前时刻输入向量权重和上一时刻输出向量的权重,通过建立AI算力服务器监测模型,对服务器内存利用率数据、风扇转速数据和服务器终端温度数据进行实时监测特征,AI算力服务器监测模型计算表达式如下所示:[0020] ;[0021] 其中, 为AI算力服务器监测模型的输出, 为当前时刻输入的时间序列集合的权重, 为当前时刻输入的时间序列集合, 为上一刻输入的时间序列集合的权重, 为上一时刻输入的时间序列集合;[0022] 令 为在t时刻的加权输入,则计算表达式如下所示:[0023] ;[0024] 其中, 为加权输入;[0025] S5、通过误差项反向传播AI算力服务器监测模型,进而对AI算力服务器运行进行调控,同时也对AI算力服务器终端运行进行调控;[0026] 通过计算AI算力服务器监测模型在t时刻的误差项,进而得出所述AI算力服务器的异构计算性能、能效性能和安全性能,计算表达式如下所示:[0027] ;[0028] 其中,为误差项, 为函数求偏导符号;[0029] 误差项则根据AI算力服务器预设阈值和实际时序数据的误差值,进而反映出内存利用率数据映射出的异构计算性能、风扇转速数据映射出的能效性能和服务器终端温度数据映射出的安全性能;[0030] S6、若AI算力服务器及AI算力服务器终端自动控制异常和超出预设阈值,则对AI算力服务器及AI算力服务器终端进行预警,获取预警数据;[0031] S7、通过可视化屏幕对AI算力服务器监测模型监测和自动调控以及预警数据进行展示。[0032] 作为本发明面向AI算力服务器的多维度性能评估方法的一种优选方案,其中:[0033] 所述服务器内存利用率、风扇转速和服务器终端温度均为确定需要监控的性能指标;[0034] 通过传感器、监控软件和数据采集工具对服务器内存利用率、风扇转速和服务器终端温度的数据进行采集;[0035] 建立一个中央数据库用于存储和管理采集到的服务器内存利用率、风扇转速和服务器终端温度的数据。[0036] 作为本发明面向AI算力服务器的多维度性能评估方法的一种优选方案,其中:[0037] 所述预设阈值包括预设性能阈值、预设转速阈值和预设温度阈值;[0038] 若异构计算性能小于预设性能阈值,则AI算力服务器内存未满,异构计算性能可延展,若异构计算性能大于预设性能阈值,则AI算力服务器内存已满,异构计算性能不可延展,对AI算力服务器进行缓存清理;[0039] 通过风扇转速进而对AI算力服务器能效性能进行判断,若风扇转速达到预设转速阈值,对AI算力服务器进行释压处理,若风扇转速未达到预设转速阈值,则不对AI算力服务器进行控制;[0040] 通过服务器终端温度数据进行对AI算力服务器终端的安全性进行判断,若温度未达到预设温度阈值,则AI算力服务器终端正常运行,若温度超过预设温度阈值,则AI算力服务器终端过载运行,需要进行调控。[0041] 作为本发明面向AI算力服务器的多维度性能评估方法的一种优选方案,其中:[0042] 通过误差项反向传播AI算力服务器监测模型,进而对AI算力服务器运行进行调控,同时也对AI算力服务器终端运行进行调控;[0043] 通过反向传播函数将误差项输出给AI算力服务器监测模型进而对AI算力服务器及AI算力服务器终端进行优化,计算表达式如下所示:[0044] ;[0045] 其中, 为校正值,T为矩阵转置,diag[]为构造对角矩阵函数;[0046] 所述校正值通过前一时刻的误差项和初始误差项,进而优化任意时刻的AI算力服务器及AI算力服务器终端。[0047] 作为本发明面向AI算力服务器的多维度性能评估方法的一种优选方案,其中:[0048] 对所述对AI算力服务器及AI算力服务器终端进行预警,及时发现AI算力服务器的性能异常或故障情况,并向管理员发送警报信息,同时设置阈值规则,当性能指标不符合阈值规则时,触发告警和应急处理流程;[0049] 将历史数据进行存储,对AI算力服务器监测模型进行优化和升级。[0050] 本发明公开了面向AI算力服务器的多维度性能评估服务器终端,其中:[0051] 数据采集模块,用于采集AI算力服务器的初始数据,所述初始数据为风扇转速、服务器终端温度和服务器内存利用率;[0052] 数据处理与分析模块,包括用于对初始数据进行预处理的数据处理单元,用于对预处理后的初始数据进行特征分析和计算权重的输入层,用于对AI算力服务器及AI算力服务器终端进行参数监测的AI算力服务器监测模型;[0053] 多维度性能评估模块,包括用于反馈AI算力服务器监测模型在t时刻的误差项的反馈单元,用于接收误差项并对AI算力服务器和AI算力服务器终端性能参数进行调整控制的性能评估单元;[0054] 可视化模块,用于展示AI算力服务器性能情况、AI算力服务器终端性能情况;[0055] 告警和监控模块,用于预警AI算力服务器及AI算力服务器终端异常情况。[0056] 一种电子设备,包括,存储器,用于存储指令;处理器,用于执行所述指令,使得所述设备执行实现面向AI算力服务器的多维度性能评估方法。[0057] 一种计算机可读存储介质,其上存储有计算机程序,该计算机程序被执行时,实现面向AI算力服务器的多维度性能评估方法。[0058] 本发明的有益效果:[0059] 本发明通过采集和分析多维度的性能数据,用户可以全面了解服务器在不同方面的性能表现,有助于发现瓶颈和问题,并进行有针对性的优化;[0060] 本发明可以实时监控服务器的性能指标,并设置阈值规则进行告警;[0061] 本发明提供直观的可视化界面,将性能数据以图表、曲线等形式展示出来,使用户能够快速了解服务器的性能情况。这简化了服务器管理和维护的工作,用户可以通过界面直观地查看性能数据,识别问题并采取相应的措施,提高管理效率;[0062] 本发明具有持续学习和优化的能力,通过不断积累新的性能数据和历史数据,本发明可以不断改进算法模型,提高性能评估和优化的准确性和效率,逐步完善多维度性能评估服务器终端的智能化水平。附图说明[0063] 为了更清楚地说明本发明实施例的技术方案,下面将对实施例描述中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本发明的一些实施例,对于本领域普通技术人员来讲,在不付出创造性劳动性的前提下,还可以根据这些附图获得其它的附图。其中:[0064] 图1为本发明面向AI算力服务器的多维度性能评估方法系统流程图;[0065] 图2为本发明面向AI算力服务器的多维度性能评估服务器终端组成图;[0066] 图3为本发明进行误差项反馈后对服务器内存利用率数据、风扇转速数据和服务器终端温度数据进行优化仿真的监测图。具体实施方式[0067] 为使本发明的上述目的、特征和优点能够更加明显易懂,下面结合说明书附图对本发明的具体实施方式做详细的说明。[0068] 在下面的描述中阐述了很多具体细节以便于充分理解本发明,但是本发明还可以采用其他不同于在此描述的其它方式来实施,本领域技术人员可以在不违背本发明内涵的情况下做类似推广,因此本发明不受下面公开的具体实施例的限制。[0069] 其次,此处所称的“一个实施例”或“实施例”是指可包含于本发明至少一个实现方式中的特定特征、结构或特性。在本说明书中不同地方出现的“在一个实施例中”并非均指同一个实施例,也不是单独的或选择性的与其他实施例互相排斥的实施例。[0070] 实施例一[0071] 如图1所示,面向AI算力服务器的多维度性能评估方法及服务器终端,包括:[0072] S1、采集AI算力服务器的初始数据,初始数据为风扇转速和服务器终端温度,以及服务器内存利用率;[0073] 服务器内存利用率、风扇转速和服务器终端温度均为确定需要监控的性能指标;[0074] 根据需求和服务器的特点,选择合适的数据采集工具,可以是传感器、监控软件或者自定义的数据采集工具。例如,可以使用传感器来监测服务器的温度、风扇转速等信息;使用监控软件来采集服务器的运行状态、资源利用情况等信息或者开发自定义的数据采集工具来获取特定的性能指标;[0075] 建立一个中央数据库用于存储和管理采集到的数据;[0076] S2、对初始数据进行数据预处理,获取时间序列集合,所述时间序列集合包括时序数据,将时序数据输入到用于数据分析的输入层;[0077] 输入层作为数据分析的输入端口,用于接收预处理后的服务器内存利用率数据、风扇转速数据和服务器终端温度数据;[0078] 由于AI算力服务器处理算法问题是多方面的,同时服务器终端的性能指标也不只是服务器终端温度,因此服务器内存利用率数据、风扇转速数据和服务器终端温度数据只作为AI算力服务器实例采集三项数据,用户可以根据实际应用需求对其他数据进行采集包括:计算能力、内存利用率、任务调度效率、实时性能等。[0079] 输入层将输入的预处理后数据进行相关性处理为时间序列集合,计算表达式如下所示:[0080] ;[0081] 其中,X为时间序列集合, 为输入的第n个时序数据,n取1,2,3,……;[0082] 输入的时序数据包括服务器内存利用率数据、风扇转速数据和服务器终端温度数据,计算表达式如下所示:[0083] ;[0084] 其中, 为n组服务器内存利用率数据, 为n组风扇转速数据, 为n组服务器终端温度数据;[0085] S3、通过对输入层处理后的时序数据进行整合,得到AI算力服务器的服务器内存利用率数据、风扇转速数据和服务器终端温度数据的特征值,进而监测AI算力服务器的实时运行状态;[0086] 对时间序列集合进行权重分析,并得出当前时刻输入向量权重和上一时刻输出向量的权重,通过建立AI算力服务器监测模型,对服务器内存利用率数据、风扇转速数据和服务器终端温度数据进行实时监测特征,AI算力服务器监测模型计算表达式如下所示:[0087] ;[0088] 其中, 为AI算力服务器监测模型的输出, 为当前时刻输入的时间序列集合的权重, 为当前时刻输入的时间序列集合, 为上一刻输入的时间序列集合的权重, 为上一时刻输入的时间序列集合;[0089] 进一步的,令 为在t时刻的加权输入,则计算表达式如下所示:[0090] ;[0091] 其中, 为加权输入。[0092] S4、通过AI算力服务器监测模型监测风扇转速、服务器终端温度和服务器内存利用率,进而对AI算力服务器的实时运行状态进行分析,进而得出AI算力服务器的异构计算性能、能效性能和安全性能;[0093] 通过计算AI算力服务器监测模型在t时刻的误差项,进而得出AI算力服务器的异构计算性能、能效性能和安全性能,计算表达式如下所示:[0094] ;[0095] 其中,为误差项, 为函数求偏导符号;[0096] 误差项则根据AI算力服务器预设阈值和实际时序数据的误差值,进而反映出内存利用率数据映射出的异构计算性能、风扇转速数据映射出的能效性能和服务器终端温度数据映射出的安全性能;[0097] 所述预设阈值包括预设性能阈值、预设转速阈值和预设温度阈值;[0098] 若异构计算性能小于预设性能阈值,则AI算力服务器内存未满,异构计算性能可延展,若异构计算性能大于预设性能阈值,则AI算力服务器内存已满,异构计算性能不可延展,需要进行清理缓存;[0099] 通过风扇转速进而对AI算力服务器能效性能进行判断,由于风扇会根据AI算力服务器运行情况进行变速转动,若风扇转速达到预设转速阈值,则AI算力服务器运行也达到阈值,需要对AI算力服务器进行释压处理,若风扇转速未达到预设转速阈值,则AI算力服务器未达到阈值,则不需要对AI算力服务器进行控制;[0100] 通过服务器终端温度数据进行对AI算力服务器终端的安全性进行判断,由于AI算力服务器终端运行芯片会产生热,因此对于温度的监测也是对AI算力服务器终端运行安全的把控,若温度未达到预设温度阈值,则AI算力服务器终端正常运行,若温度超过预设温度阈值,则AI算力服务器终端过载运行,需要进行调控;[0101] S5、通过误差项反向传播AI算力服务器监测模型,进而对AI算力服务器运行进行调控,同时也对AI算力服务器终端运行进行调控;[0102] 其中,通过反向传播函数将误差项输出给AI算力服务器监测模型进而对AI算力服务器及AI算力服务器终端进行优化,计算表达式如下所示:[0103] ;[0104] 其中, 为校正值,T为矩阵转置,diag[]为构造对角矩阵函数;[0105] 构建的对角矩阵表达式如下所示:[0106] ;[0107] 校正值通过前一时刻的误差项和初始误差项,进而优化任意时刻的AI算力服务器及AI算力服务器终端。[0108] 如图3所示,对服务器内存利用率、风扇转速和服务器终端温度进行误差项反馈后,根据风扇转速误差值、服务器终端温度误差值、服务器内存利用率误差值对AI算力服务器及AI算力服务器终端的参数进行调节;图3中的x轴为时间,y轴为反馈误差值;[0109] S6、若AI算力服务器及服务器终端自动控制异常和超出预设阈值,则对AI算力服务器及服务器终端进行预警,获取预警数据;[0110] 进一步的,引入实时告警和监控机制,及时发现服务器性能异常或故障情况,并向管理员发送警报信息。可以设置阈值规则,当某项性能指标不符合阈值规则时,自动触发告警和应急处理流程。[0111] 进一步的,将历史数据进行存储,对AI算力服务器监测模型进行优化和升级;[0112] S7、通过可视化屏幕对AI算力服务器监测模型监测和自动调控以及预警数据进行展示。[0113] 实施例二[0114] 如图2所示,面向AI算力服务器的多维度性能评估服务器终端,包括,[0115] 数据采集模块,建立一个完善的数据采集系统,实时监控AI算力服务器各项性能指标,包括计算能力、内存利用率、功耗情况、任务响应时间、数据传输速度等。可以利用传感器、监控软件或自定义的数据采集工具进行数据采集。[0116] 数据处理与分析模块,收集到的性能数据需要经过处理和分析,以提取有用的信息和指标。设计相应的数据处理算法和分析模型,对多维度数据进行整合、统计和可视化,帮助用户深入了解服务器性能表现。[0117] 多维度性能评估模块,建立一个多维度性能评估指标库,包括多任务性能、异构计算性能、实时性能、能效性能、可扩展性、安全性能和可靠性等方面的指标,以便对服务器性能进行全面评估。[0118] 可视化模块,设计直观、易用的可视化界面,将性能数据以图表、曲线等形式展示出来,帮助用户快速了解服务器性能情况。用户可以通过界面查看不同性能指标的变化趋势,分析问题根源并采取相应的优化措施。[0119] 告警和监控模块,引入实时告警和监控机制,及时发现服务器性能异常或故障情况,并向管理员发送警报信息。可以设置阈值规则,当某项性能指标不符合阈值规则时,系统能够自动触发告警和应急处理流程。[0120] 一种面向AI算力服务器的多维度性能评估服务器终端,硬件配置清单:[0121] 数据处理单元,包括:[0122] 面向AI算力服务器的多维度性能评估服务器终端的处理器:选择高性能的处理器,如英特尔Xeon或AMDEPYC,以提供足够的计算能力。[0123] 面向AI算力服务器的多维度性能评估服务器终端的内存:配置大容量的内存,以支持处理大规模的数据和模型。[0124] 面向AI算力服务器的多维度性能评估服务器终端的存储:选择高速的固态硬盘(SSD)来存储数据和模型。[0125] 面向AI算力服务器的多维度性能评估服务器终端的GPU:集成支持深度学习任务的强大GPU,如NVIDIA的Tesla或RTX系列。[0126] 面向AI算力服务器的多维度性能评估服务器终端的网络连接:提供高速的网络连接,以便与其他设备进行数据传输和远程访问。[0127] 所述服务器终端还包括软件操作单元,所述软件操作单元包括:[0128] 面向AI算力服务器的多维度性能评估服务器终端的操作系统:选择适合的操作系统,如Linux或WindowsServer,以支持AI算力服务器的运行和管理。[0129] 面向AI算力服务器的多维度性能评估服务器终端的AI框架:安装和配置流行的AI框架,如TensorFlow、PyTorch和Keras,以便进行深度学习任务。[0130] 面向AI算力服务器的多维度性能评估服务器终端的驱动程序和库:安装和更新GPU驱动程序和相关的深度学习库,以确保系统正常工作。[0131] 面向AI算力服务器的多维度性能评估服务器终端的远程管理工具:使用远程管理工具,如SSH或远程桌面,方便管理员进行远程访问和管理。[0132] 所述服务器终端还包括系统管理单元:所述系统管理单元用于对面向AI算力服务器的多维度性能评估服务器终端进行监控和诊断:实现服务器终端的监控和诊断功能,以及实时检查服务器的状态和性能;还用于对面向AI算力服务器的多维度性能评估服务器终端进行资源调度:实现资源调度功能,以合理分配计算资源和GPU资源给不同的任务;还用于任务管理:提供任务管理功能,包括任务队列、优先级设置和任务调度;还用于加强服务器终端的安全性:加强服务器的安全性,包括访问控制、身份验证和数据加密。[0133] 所述服务器终端还包括系统存储单元,所述系统存储单元用于增强面向AI算力服务器的多维度性能评估服务器终端的可扩展性:设计服务器终端时考虑到可扩展性,以便根据需要添加更多的计算资源和存储空间;还用于对面向AI算力服务器的多维度性能评估服务器终端实现冗余和备份:实现冗余和备份机制,以确保数据的安全性和可用性;还用于增加面向AI算力服务器的多维度性能评估服务器终端的容错性:采用容错技术,如RAID(冗余磁盘阵列)来保护数据免受硬件故障的影响。本申请中的AI算力服务器终端以及服务器终端均表示一种面向AI算力服务器的多维度性能评估服务器终端。[0134] 实施例三[0135] 一种电子设备,包括,存储器,用于存储指令;处理器,用于执行指令,使得设备执行实现面向AI算力服务器的多维度性能评估方法。[0136] 实施例四[0137] 一种计算机可读存储介质,其上存储有计算机程序,该计算机程序被执行时,实现面向AI算力服务器的多维度性能评估方法。[0138] 重要的是,应注意,在多个不同示例性实施方案中示出的本申请的构造和布置仅是例示性的。尽管在此公开内容中仅详细描述了两个实施方案,但参阅此公开内容的人员应容易理解,在实质上不偏离该申请中所描述的主题的新颖教导和优点的前提下,许多改型是可能的例如,各种元件的尺寸、尺度、结构、形状和比例、以及参数值(例如,温度、压力等)、安装布置、材料的使用、颜色、定向的变化等。例如,示出为整体成形的元件可以由多个部分或元件构成,元件的位置可被倒置或以其它方式改变,并且分立元件的性质或数目或位置可被更改或改变。因此,所有这样的改型旨在被包含在本发明的范围内。可以根据替代的实施方案改变或重新排序任何过程或方法步骤的次序或顺序。任何“装置加功能”的条款都旨在覆盖在本文中所描述的执行功能的结构,且不仅是结构等同而且还是等同结构。在不背离本发明的范围的前提下,可以在示例性实施方案的设计、运行状况和布置中做出其他替换、改型、改变和省略。因此,本发明不限制于特定的实施方案,而是扩展至仍落在所附的权利要求书的范围内的多种改型。[0139] 此外,为了提供示例性实施方案的简练描述,可以不描述实际实施方案的所有特征(即,与当前考虑的执行本发明的最佳模式不相关的那些特征,或于实现本发明不相关的那些特征)。[0140] 应理解的是,在任何实际实施方式的开发过程中,如在任何工程或设计项目中,可做出大量的具体实施方式决定。这样的开发努力可能是复杂的且耗时的,但对于那些得益于此公开内容的普通技术人员来说,不需要过多实验,开发努力将是一个设计、制造和生产的常规工作。[0141] 应说明的是,以上实施例仅用以说明本发明的技术方案而非限制,尽管参照较佳实施例对本发明进行了详细说明,本领域的普通技术人员应当理解,可以对本发明的技术方案进行修改或者等同替换,而不脱离本发明技术方案的精神和范围,其均应涵盖在本发明的权利要求范围当中。

专利地区:山东

专利申请日期:2024-08-12

专利公开日期:2024-11-05

专利公告号:CN118626358B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
搜索
搜本页
欢迎咨询

扫码可加微信,手机访问拨打咨询

欢迎咨询

欢迎咨询
数据加载中...