产学研创新服务平台(全国)
专利申请类型:发明专利;专利名称:一种基于联合特征的MIV沉浸式视频率失真优化方法
专利类型:发明专利
专利申请号:CN202410807401.1
专利申请(专利权)人:华侨大学
权利人地址:福建省泉州市丰泽区城东城华北路269号
专利发明(设计)人:曾焕强,孔庆玮,朱建清,施一帆,陈婧,杨慰民,蔡磊,夏至贤
专利摘要:本发明公开了一种基于联合特征的MIV沉浸式视频率失真优化方法,涉及视频编码领域,包括:计算像素的几何失真权重;将帧内划分为纹理区域与深度区域,提取纹理区域的纹理复杂度特征、纹理区域的边缘特征和深度区域的边缘特征,自适应融合纹理区域的边缘特征和深度区域的边缘特征以得到融合边缘特征;使用纹理复杂度特征与融合边缘特征组成的联合特征,计算得到纹理区域的失真度量缩放因子与深度区域的失真度量缩放因子;根据纹理区域的失真度量缩放因子、失真度量缩放因子和几何失真权重计算新拉格朗日乘子;基于新拉格朗日乘子实现沉浸式视频的率失真优化。本发明可以使得最终渲染的沉浸式视频具有更好的渲染质量与率失真性能。
主权利要求:
1.一种基于联合特征的MIV沉浸式视频率失真优化方法,其特征在于,包括以下步骤:S1,在MIV编码平台以Pack模式编码沉浸式视频序列时,计算像素的几何失真权重;
S2,编码沉浸式视频Pack图集时,帧内划分纹理区域与深度区域,并提取纹理区域的纹理复杂度特征、纹理区域的边缘特征和深度区域的边缘特征;对纹理区域的边缘特征和深度区域的边缘特征进行自适应融合,得到融合边缘特征;
S3,使用纹理复杂度特征、融合边缘特征以及几何失真权重计算得到纹理区域的失真度量缩放因子与深度区域的失真度量缩放因子;
S4,根据纹理区域的失真度量缩放因子计算纹理区域的新拉格朗日乘子,根据深度区域的失真度量缩放因子计算深度区域的新拉格朗日乘子,使用新拉格朗日乘子实现沉浸式视频的率失真优化;
所述S1包括以下步骤:
根据相机类型计算像素i的归一化三维坐标
根据归一化三维坐标 计算像素i所对应的世界坐标(X,Y,Z),表示为:其中,d表示像素i的深度值, 表示旋转矩阵, 表示相机的空间位置向量;
计算像素i的局部邻域内的k个样本点所组成的平面,表示为:Z=UX+VY+W1;
其中,U,V,W1为该平面常系数参数,通过最小二乘法计算得到,表示为:其中,(Xj,Yj,Zj)表示像素i的局部邻域内第j个样本点的世界坐标;
计算像素i所对应的法向量n,表示为:
n=(U,V,‑1);
根据像素i的法向量n计算像素i的几何失真权重,表示为:所述S3包括以下步骤:
计算纹理区域每一个CU的失真度量缩放因子ξ,表示为:其中,α0和β0为正权重系数,负责调节特征的影响权重,TC为当前CU的纹理复杂度,为当前CU的融合边缘特征图的均值,O表示有效像素占用比率,由该CU中的有效像素除以总像素数得到,ρ表示有效像素比例阈值;
计算深度区域每一个CU的失真度量缩放因子ε,表示为:其中,α1、β1和 均表示正权重系数,负责调节特征的影响权重, 为当前CU所有像素对应的几何失真权重均值;
所述S4计算的新拉格朗日乘子,表示为:
其中,λT为纹理区域的原始拉格朗日乘子,λG为深度区域的原始拉格朗日乘子,λT′为纹理区域的新拉格朗日乘子,λG′为深度区域的新拉格朗日乘子。
2.根据权利要求1所述的一种基于联合特征的MIV沉浸式视频率失真优化方法,其特征在于,所述根据相机类型计算像素i的归一化三维坐标 包括:当相机为透视相机时,像素i的归一化坐标为:
其中,u1,v1表示图像坐标系下像素i的横坐标与纵坐标,ch,cv表示图像坐标系下投影焦点的水平分量和垂直分量,fh,fv表示图像坐标系下主点的水平分量和垂直分量;
当相机为ERP类型的全景相机时,像素i的归一化坐标为:其中,wI和hI分别表示图像的宽度和高度,θmin和θmax分别表示ERP投影所对应极角的最小值和最大值,φmin和φmax分别表示ERP投影所对应的方位角的最小值和最大值,u2和v2分别表示投影平面像素的水平和垂直坐标;
当相机为正交投影时,像素i的归一化坐标为:
3.根据权利要求1所述的一种基于联合特征的MIV沉浸式视频率失真优化方法,其特征在于,所述S2包括以下步骤:根据输入的纹理区域的起始坐标与区域大小以及深度区域的起始坐标与区域大小,将当前编码帧划分为纹理区域与深度区域;
使用多方向的Gabor滤波器提取纹理区域的纹理复杂度特征,所述多方向的Gabor滤波器为2D‑Gabor滤波器,表示为:x′=xcosθ+ysinθ;
y′=‑xsinθ+ycosθ;
其中,F为滤波器的中心频率,θ为滤波器的方向角度,γ和η分别为两个方向上高斯函数包络线的标准差,x和y表示像素的横坐标与纵坐标,x′和y′表示x和y转换后的中间坐标值;
使用整体嵌套边缘检测网络HED网络分别提取纹理区域的边缘特征 与深度区域的边缘特征 自适应融合纹理区域的边缘特征 与深度区域的边缘特征 得到融合边缘特征
4.根据权利要求3所述的一种基于联合特征的MIV沉浸式视频率失真优化方法,其特征在于,所述使用多方向的Gabor滤波器提取纹理区域的纹理复杂度特征,包括以下步骤:获取输入图像I(x,y)的Gabor特征图Eθ,F,γ,η(x,y),表示为:其中, 和 表示2D‑Gabor滤波器根据欧拉公式分解的两个子滤波器,表示为:
计算纹理区域的复杂度TC,表示为:
其中,H表示纹理区域的高度,W表示纹理区域的宽度;N为滤波器的个数,每个滤波器具有不同的中心频率F以及方向角度θ,γ和η分别表示两个方向上高斯函数包络线的标准差;
表示特征图的均值, 表示特征图的标准差。
5.根据权利要求3所述的一种基于联合特征的MIV沉浸式视频率失真优化方法,其特征在于,所述自适应融合纹理区域的边缘特征 与深度区域的边缘特征 表示为:其中,α表示边缘响应一致性系数,D(·)表示一致性度量函数,UP表示上采样函数。 说明书 : 一种基于联合特征的MIV沉浸式视频率失真优化方法技术领域[0001] 本发明涉及视频编码领域,尤其涉及一种基于联合特征的MIV沉浸式视频率失真优化方法。背景技术[0002] 随着采集、交互与显示等技术的发展,作为新一代视频媒体技术的沉浸式视频逐渐成为研究热点。沉浸式视频支持用户以6自由度(DegreesofFreedom,DoF)地观看三维场景,给用户带来身临其境之感。为此,沉浸式视频需要包含场景的三维信息,场景的数据形式包含多视点加深度图视频,光场与点云数据等,形式复杂,数据量庞大,传输、存储面临严峻考验。运动图像专家组(MovingPictureExpertsGroup,MPEG)因此针对沉浸式视频提出了新的编码标准MIV(MPEGImmersiveVideo)。MIV主要以多视点加深度图视频(Multi‑ViewplusDepthmapvideo,MVD)作为信号源,通过基于视点渲染的方式压缩多视点间的冗余,得到多视点数据的紧凑表示形式图集(atlas),图集再通过2D视频编码器压缩时空冗余得到二进制码流。[0003] 视频编码的目标是在保证视频质量的前提下尽量降低视频码流消耗的比特,然而编码输出的码率与重建视频质量之间是相互制约与矛盾的。视频编码中的率失真优化是基于率失真理论寻找最优的编码参数值,达到码率与质量之间平衡,是提高编码器性能的主要方法之一。率失真优化过程可以表述为在不超过限定码率的条件下,使重建视频的失真最小。在MIV的Pack模式中,纹理图集与深度图集被封装在同一帧中,现有视频编码器的率失真过程缺少对于深度特性与纹理特性的联合考虑,导致率失真性能不佳。发明内容[0004] 本发明的目的在于解决现有技术中由于缺少联合考虑深度特性与纹理特性而导致率失真性能不佳的问题。[0005] 本发明解决其技术问题所采用的技术方案是:提供一种基于联合特征的MIV沉浸式视频率失真优化方法,包括以下步骤:[0006] S1,在MIV编码平台以Pack模式编码沉浸式视频序列时,计算像素的几何失真权重;[0007] S2,编码沉浸式视频Pack图集时,帧内划分纹理区域与深度区域,并提取纹理区域的纹理复杂度特征、纹理区域的边缘特征和深度区域的边缘特征;对纹理区域的边缘特征和深度区域的边缘特征进行自适应融合,得到融合边缘特征;[0008] S3,使用纹理复杂度特征、融合边缘特征以及几何失真权重计算得到纹理区域的失真度量缩放因子与深度区域的失真度量缩放因子;[0009] S4,根据纹理区域的失真度量缩放因子计算纹理区域的新拉格朗日乘子,根据深度区域的失真度量缩放因子计算深度区域的新拉格朗日乘子,使用新拉格朗日乘子实现沉浸式视频的率失真优化。[0010] 优选的,所述S1包括以下步骤:[0011] 根据相机类型计算像素i的归一化三维坐标[0012] 根据归一化三维坐标 计算像素i所对应的世界坐标(X,Y,Z),表示为:[0013][0014] 其中,d表示像素i的深度值, 表示旋转矩阵, 表示相机的空间位置向量;[0015] 计算像素i的局部邻域内的k个样本点所组成的平面,表示为:[0016] Z=UX+VY+W1;[0017] 其中,U,V,W1为该平面常系数参数,通过最小二乘法计算得到,表示为:[0018][0019] 其中,(Xj,Yj,Zj)表示像素i的局部邻域内第j个样本点的世界坐标;[0020] 计算像素i所对应的法向量n,表示为:[0021] n=(U,V,‑1);[0022] 根据像素i的法向量n计算像素i的几何失真权重,表示为:[0023][0024] 优选的,所述根据相机类型计算像素i的归一化三维坐标 包括:[0025] 当相机为透视相机时,像素i的归一化坐标为:[0026][0027] 其中,u1,v1表示图像坐标系下像素i的横坐标与纵坐标,ch,cv表示图像坐标系下投影焦点的水平分量和垂直分量,fh,fv表示图像坐标系下主点的水平分量和垂直分量;[0028] 当相机为ERP类型的全景相机时,像素i的归一化坐标为:[0029][0030][0031] 其中,wI和hI分别表示图像的宽度和高度,θmin和θmax分别表示ERP投影所对应极角的最小值和最大值,φmin和φmax分别表示ERP投影所对应的方位角的最小值和最大值,u2和v2分别表示投影平面像素的水平和垂直坐标;[0032] 当相机为正交投影时,像素i的归一化坐标为:[0033][0034] 优选的,所述S2包括以下步骤:[0035] 根据输入的纹理区域的起始坐标与区域大小以及深度区域的起始坐标与区域大小,将当前编码帧划分为纹理区域与深度区域;[0036] 使用多方向的Gabor滤波器提取纹理区域的纹理复杂度特征,所述多方向的Gabor滤波器为2D‑Gabor滤波器,表示为:[0037][0038] x′=xcosθ+ysinθ;[0039] y′=‑xsinθ+ycosθ;[0040] 其中,F为滤波器的中心频率,θ为滤波器的方向角度,γ和η分别为两个方向上高斯函数包络线的标准差,x和y表示像素的横坐标与纵坐标,x′和y′表示x和y转换后的中间坐标值;[0041] 使用整体嵌套边缘检测网络HED网络分别提取纹理区域的边缘特征 与深度区域的边缘特征 自适应融合纹理区域的边缘特征 与深度区域的边缘特征 得到融合边缘特征[0042] 优选的,所述使用多方向的Gabor滤波器提取纹理区域的纹理复杂度特征,包括以下步骤:[0043] 获取输入图像I(x,y)的Gabor特征图Eθ,F,γ,η(x,y),表示为:[0044][0045][0046] 其中, 和 表示2D‑Gabor滤波器根据欧拉公式分解的两个子滤波器,表示为:[0047][0048] 计算纹理区域的复杂度TC,表示为:[0049][0050] 其中,H表示纹理区域的高度,W表示纹理区域的宽度;N为滤波器的个数,每个滤波器具有不同的中心频率F以及方向角度θ,γ和η分别表示两个方向上高斯函数包络线的标准差;μθ,F,γ,η表示特征图的均值,σθ,F,γ,η表示特征图的标准差。[0051] 优选的,所述自适应融合纹理区域的边缘特征 与深度区域的边缘特征 表示为:[0052][0053] 其中,α表示边缘响应一致性系数,D(·)表示一致性度量函数,UP表示上采样函数。[0054] 优选的,所述S3包括以下步骤:[0055] 计算纹理区域每一个CU的失真度量缩放因子ξ,表示为:[0056][0057] 其中,α0和β0为正权重系数,负责调节特征的影响权重,TC为当前CU的纹理复杂度,为当前CU的融合边缘特征图的均值,O表示有效像素占用比率,由该CU中的有效像素除以总像素数得到,ρ表示有效像素比例阈值;[0058] 计算深度区域每一个CU的失真度量缩放因子ε,表示为:[0059][0060] 其中,α1、β1和τ均表示正权重系数,负责调节特征的影响权重, 为当前CU所有像素对应的几何失真权重均值。[0061] 优选的,所述S4计算的新拉格朗日乘子,表示为:[0062][0063] 其中,λT为纹理区域的原始拉格朗日乘子,λG为深度区域的原始拉格朗日乘子,λT′为纹理区域的新拉格朗日乘子,λG′为深度区域的新拉格朗日乘子。[0064] 本发明具有如下有益效果:[0065] (1)本发明在编码Pack图集时通过建立联合特征,改变原始率失真模型中的拉格朗日因子,使率失真代价的计算更为合理;相比现有MIV编码沉浸式视频使用的2D视频编码器(缺少对Pack图集中纹理区域与深度区域的综合考虑),可以获得更好的渲染质量与编码码率的率失真性能。[0066] (2)本发明针对人类视觉系统特性,根据纹理区域的纹理复杂度、纹理区域与深度区域的融合边缘特征以及CU的有效像素占比,在率失真过程中对不同区域得到不同的失真度量缩放因子,建立基于纹理复杂度特征与融合边缘特征组成的联合特征的率失真优化模型,提高沉浸式视频的感知编码性能。[0067] 以下结合附图及实施例对本发明作进一步详细说明,但本发明不局限于实施例。附图说明[0068] 图1为本发明实施例的方法步骤图;[0069] 图2为本发明实施例的编码流程图;[0070] 图3为本发明实施例计算几何失真权重的流程图;[0071] 图4为本发明实施例提取纹理区域和深度区域相关特征并进行率失真的流程图。具体实施方式[0072] 参见图1所示,为本发明实施例的方法步骤图,包括以下步骤:[0073] S1,在MIV编码平台以Pack模式编码沉浸式视频序列时,计算像素的几何失真权重;[0074] S2,编码沉浸式视频Pack图集时,帧内划分纹理区域与深度区域,并提取纹理区域的纹理复杂度特征、纹理区域的边缘特征和深度区域的边缘特征;对纹理区域的边缘特征和深度区域的边缘特征进行自适应融合,得到融合边缘特征;纹理复杂度特征与融合边缘特征组成联合特征;[0075] S3,使用纹理复杂度特征与融合边缘特征组成的联合特征以及几何失真权重计算得到纹理区域的失真度量缩放因子与深度区域的失真度量缩放因子;[0076] S4,根据纹理区域的失真度量缩放因子计算纹理区域的新拉格朗日乘子,根据深度区域的失真度量缩放因子计算深度区域的新拉格朗日乘子,使用新拉格朗日乘子实现沉浸式视频的率失真优化。[0077] 参见图2及图4所示,为本发明实施例的编码流程图,编码步骤包括:[0078] 步骤一,编码平台输入沉浸式视频序列与相关配置信息,在MIV完成图集生成后,计算像素的几何失真权重,流程如图3所示。遍历图集中深度区域的所有像素位置,如果当前像素如属于有效像素,则获取当前位置所属patch信息,计算像素的归一化坐标,以及对应的法向量,并计算几何失真权重。具体的,当相机为透视相机时,像素i的归一化坐标计算公式为:[0079][0080] 其中,u1,v1代表图像坐标系下像素i的横坐标与纵坐标,ch,cv代表图像坐标系下投影焦点的水平分量和垂直分量,fh,fv代表图像坐标系下主点的水平分量和垂直分量。[0081] 当相机为ERP类型的全景相机时,像素i的归一化坐标计算公式为:[0082][0083] 其中,wI和hI分别代表图像的宽度和高度,θmin和θmax代表ERP投影所对应的极角的最小值和最大值,φmin和φmax代表ERP投影所对应的方位角的最小值和最大值,u2和v2分别代表投影平面像素的水平和垂直坐标。[0084] 当相机模型为正交投影时,像素i的归一化坐标计算公式为:[0085][0086] 其中,u1,v1代表图像坐标系下像素i的横坐标与纵坐标。[0087] 之后通过将像素局部邻域近似为平面,并计算平面方程,估计像素i所对应的法向量。像素i所对应的世界坐标计算如下:[0088][0089] 其中,d代表像素i的深度值, 代表旋转矩阵, 代表相机的空间位置向量。像素i的局部邻域内的k个样本点所组成的平面公式如下:[0090] Z=UX+VY+W1;[0091] 其中,U,V,W1为该平面常系数参数,通过最小二乘法计算得到:[0092][0093] 则像素i所对应的法向量n为:[0094] n×(U,V,‑1);[0095] 最后计算像素i的几何失真权重,像素i的几何失真权重的计算公式为:[0096][0097] 步骤二,使用VVC、HEVC等支持MIV标准的二维视频编码器编码沉浸式视频Pack图集;以VCC为例,VVC编码平台输入Pack图集数据,在编码每帧前,读取对应集合失真权重图,当前编码帧定义为Fcur。[0098] 步骤三,将当前编码帧根据输入的纹理区域位置与深度区域位置,划分为纹理区域与深度区域,纹理区域记为 深度区域记为[0099] 步骤四,将纹理区域和深度区域以尺寸128×128的编码树单元(CodingTreeUint,CTU)进行划分,Fcur包含的CTU总数定义为Num,当前编码的CTU记为CTUcur,当前编码CTU序号记为i(1≤i≤Num)。[0100] 步骤五,计算当前CTU的纹理复杂度,首先提取纹理复杂度特征,如果当前CTU属于纹理区域,则使用多方向Gabor滤波器提取当前CTU的纹理复杂度特征,如果为当前CTU为深度区域,则需要计算对应的纹理区域的纹理复杂度特征,具体如下:[0101] 所述多方向的Gabor滤波器为2D‑Gabor滤波器,2D‑Gabor滤波器的公式为:[0102][0103] x′=xcosθ+ysinθ;[0104] y′=‑xsinθ+ycosθ;[0105] 其中,F为滤波器的中心频率,θ为滤波器的方向角度,γ和η分别为两个方向上高斯函数包络线的标准差,x和y分别为水平和垂直坐标,x′和y′表示x和y转换后的中间坐标值。[0106] 2D‑Gabor滤波器可以由欧拉公式分解为两个子滤波器 和表示为:[0107][0108] 输入图像I(x,y)的Gabor特征图Eθ,F,γ,η(x,y)由输入图像与子滤波器分别卷积获得:[0109][0110] 特征图的均值定义为:[0111][0112] 特征图的标准差被定义:[0113][0114] 当前CTU的纹理复杂度定义为:[0115][0116] 其中,N为滤波器的个数,每个滤波器具有不同的频率F以及方向θ。[0117] 步骤六,计算当前CTU的融合边缘特征,具体如下:[0118] 分别使用HED网络提取的纹理区域和深度区域得到边缘特征图 以及深度区域边缘特征图 融合边缘特征图定义为:[0119][0120] 其中,UP表示上采样函数,α代表边缘响应一致性系数,由下面公式计算:[0121][0122] 其中,D(·)代表一致性度量函数,通过计算局部区域结构差异性,以表征边缘响应的一致性,使用SSIM作为一致性度量函数,最后使用融合边缘特征图 的均值 作为当前CTU的融合边缘特征。[0123] 步骤七,根据纹理复杂度特征与融合边缘特征组成联合特征计算当前CTU的失真度量缩放因子,具体包括:如果当前CTU为纹理区域,则失真度量缩放因子ξ计算公式如下:[0124][0125] 其中,α0和β0为正权重系数,负责调节特征的影响权重。TC为当前CU的纹理复杂度,为当前CU的融合边缘特征图的均值,O代表有效像素占用比率,由该CU中的有效像素(占用像素)除以总像素数得到,ρ代表有效像素比例阈值。[0126] 如果当前CTU为深度区域,则失真度量缩放因子η计算公式如下:[0127][0128] 其中,α1、β1和τ均为正权重系数,负责调节特征的影响权重, 为当前CTU所有像素对应的几何失真权重均值。[0129] 步骤八,根据失真度量缩放因子,计算新的拉格朗日乘子,实现改善MIV的渲染质量与深度图码率的率失真性能,具体包括:[0130] 纹理区域的新拉格朗日乘子计算公式如下:[0131][0132] 其中,λT为纹理区域的原始拉格朗日乘子。[0133] 纹理区域的率失真优化函数为:[0134][0135] 深度区域的新拉格朗日乘子计算公式如下:[0136][0137] 深度区域的率失真优化函数为:[0138][0139] 步骤九,将CTUi+1作为CTUcur,返回步骤四继续执行,直至Fcur中所有CTU完成编码,再执行步骤十。[0140] 步骤十,将下一待编码帧作为当前编码帧,返回步骤三继续执行,直至所有待编码帧完成编码。[0141] 为了进一步说明本发明方法的可行性与有效性,进行如下实验。[0142] 本发明方法在MIV编码标准的TMIV14.1编码测试平台和VVC编码标准的VVenc0.3.1编码测试平台上实施。测试模式为MIVPack模式,相关量化参数由标准设置的测试情况决定,使用标准测试序列,具体情况如表1所示:[0143] 表1实验序列[0144][0145] 为了说明本发明方法对提供沉浸式视频编码效果的显著性,将本发明方法与原始TMIV14.1与VVenc0.3.1平台进行了对比,实验中使用BDBR来比较视频编码算法的率失真性能。BD‑BR显示了在视频相同的质量下,所消耗比特率的变化情况,负值代表在相同质量下码率消耗下降,即对比算法编码性能相对基准更优。为了充分说明实验结果的性能,我们计算了BDBR(IVPSNR),BDBR(MS‑SSIM),BDBR(VMAF)3种BDBR指标。[0146] 表2实验结果[0147][0148] 虽然以上描述了本发明的具体实施方式,但是熟悉本技术领域的技术人员应当理解,我们所描述的具体的实施例只是说明性的,而不是用于对本发明的范围的限定,熟悉本领域的技术人员在依照本发明的精神所作的等效的修饰以及变化,都应当涵盖在本发明的权利要求所保护的范围内。以上仅为本发明的较佳实施例,并不用以限制本发明,凡在本发明的精神和原则之内,所作的任何修改、等同替换、改进等,均应包含在本发明的保护范围之内。
专利地区:福建
专利申请日期:2024-06-21
专利公开日期:2024-09-17
专利公告号:2024-09-17