A Blind Stereoscopic Image Quality Evaluator With Segmented Stacked Autoencoders
摘要该论文模拟了人类视觉感知的全过程从人眼到额叶特别是针对视网膜神经细胞RGCs和外侧膝状体核(LGNs)中的边缘和颜色的信号处理。除此之外为了模拟视觉皮层的复杂的和深度的结构采用了分段堆放自编码器S-SAE这在之前的3DIQA中是没有应用过的。S-SAE的应用弥补了基于深度学习的IQA训练需要十分长的训练时间的问题。介绍人们都是用双眼看世界的并且视网膜上的图像略有不同。两个视角通过RGCs压缩保留了边缘信息同时颜色信息也通过RGCs传递。这些信息之后被传递给LGNs之后在初级视觉皮层进行融合每一部分的视觉皮层看似都有各自的功能但是无法将它们分离出来经过复杂的处理过程后传递给额叶得出预测的质量分数。该算法的贡献可分为以下部分整个路线被分为两个字路线分别处理边缘信号和颜色信号之后两部分会各自产生一个分数即边缘分数和颜色分数。具体如下左右视图的轮廓信息被提取来模拟RGCs的边缘提取这部分将被用于计算中间过程的合成图如和、差、独眼视图。颜色信息不是发生在IQA的全过程中的这里对发生在LGNs中的对手编码进行了建模。S-SAE被用来模拟视觉皮层中的深层和复杂的结构其不仅解决了SAE的训练花费大量时间的缺点而且有高的准确率。三个S-SAE被用于边缘信息中一个SAE被用于颜色信息中最终被用于SVR中得出各自的质量分数。两个动态权重系统和一个静态权重系统被用于将局部感知分数组合得出最终的分数。背景视网膜神经细胞和外侧膝状体核视觉系统具有将复杂众多的视觉信息压缩的功能这部分是在RGCs中实现的。它们有单细胞P、近细胞(K)和巨细胞(M)。P和P携带颜色信息M携带运动和边缘信息。总的来说只有边缘和变化被提取出来并通过LGNs传递到V1。除了边缘信息RGCs也参与了颜色信息的提取和LGN的P、K细胞共同作用实现了对抗编码。这些锥细胞可分为三类L- M-和S-分别对长波长红光、中波长绿光和短波长蓝光。这里存在三个编码通道红绿、蓝黄和明暗P是对红绿方面的颜色敏感K是对蓝黄的颜色敏感。因此计算这三个部分的成分并最终传递给V1。实验发现在V1区域不仅存在sum、cyclopean还存在diff。S-SAE因为人脑的视觉处理过程是比较复杂的从V1区到IT区域这里使用S-SAE来模拟更深层和复杂的特征提取过程在该过程提取后的特征输入到SVR中进行训练得出感知分数。算法实施生理建模首先视觉神经细胞接收到外界的刺激R,G,B成分之后这些视觉刺激被传递到RGCs并且边缘信息由RGCs提取接下来R G B图像和边缘信息被传入LGNs并且对手编码发生在这里之后RG、BY、和Lum信号以及边缘信息以P、K、M流的形式传输到视觉皮层V1区域。在该区域左右视图合成为S、D和C图像。到目前为止产生了6个不同类型的映射图紧接着边缘和颜色特征提取将会在之后发生最后提取的特征会经过30多个视觉处理区域从而生成更加复杂和抽象的特征这些特征最终会传输到额叶并获得感知质量。算法建模总体分为两个子部分边缘质量索引和颜色质量索引。边缘提取使用LoG滤波器模拟RGCs的特征提取过程采取三个不同的参数进行提取n为滤波器的大小另一个参数为标准差高斯低通滤波器这模拟了在V1区域中不同的边缘检测算子结果三个左三个右LoG映射图被提取出来之后这三种边缘映射图被融合成S D C图每个图会有三种融合过程如下之后分别对融合图进行特征提取这些特征进一步会经过S-SAE训练以得到更加深层和抽象的特征最终所得到的特征输入SVR得到局部质量分数这些质量分数之后经过池化操作得到边缘特征的质量分数。颜色图使用以下公式模拟对手编码之后对这些映射图进行特征提取将提取到的特征输入到SAE网络中以得到更加深层和抽象的特征最后输入到SVR中得到颜色质量分数结合颜色质量分数和边缘质量分数可以得到最终的质量分数。特征提取对边缘图融合得到的图进行MSCN变换观察到其直方图的峰值和方差随着DMOS变化除了白噪声失真。当DMOS变大时其直方图的峰值和方差会变小乘积对的变化也和以上相似。对MSCN图进行广义高斯分布和非对称广义高斯分布拟合分别得到2个、16个拟合参数除此之外计算MSCN图的幅值、方差和熵特征最后再加上对比度特征最终每张图得到22个特征值三张图产生66个特征这些特征之后会用于S-SAE训练来得到边缘信息特征。对于颜色映射图使用AGGD拟合得到形状、左方差和右方差三个拟合参数同时映射图的峰值和偏离度也作为特征进行了提取5x3x230最终得到30个特征使用这些特征进行之后的SAE训练来得到颜色信号处理。池化系统研究发现弱相关的两眼图像对的和差通道的权重相似。但是一般情况下这些图像具有很强的相关性并且给差值通道分配了较大的权重。因此这里采用了动态权重系统这里的L和R不是图像本身而是之前提取的22个特征值C10.6 , C25以此来达到当图像弱相关时差通道仍然能得到更大的权重结果同样池化Qc质量分数时当图像弱相关时应赋予Qc更大的权重当处于弱相关时赋予两者相似的权重其权重为其中C30.55C40.8最终按照加权和得到边缘感知分数由于边缘特征质量分数比颜色特征质量分数更加重要因此前者所占比重为0.7后者为0.3且采用静态权重的方式最终得到全局质量分数。其整体流程图如下个人感想总的来说这篇文章使用的神经网络部分还是比较少的大部分的特征提取还是传统的方法不过还是有以下几点可供参考使用了多个融合图使用了颜色信息特征特征提取部分还是使用了MSCN再得到相关统计信息使用S-SAE进行深层次的特征提取分别计算局部质量分数再将质量分数进行加权融合得到最终的分数个人感觉在特征提取时先进行边缘特征提取再进行深层的特征提取有些限制了特征提取的范围之后的提取相当于都是在边缘信息之上提取的有了边缘信息的限制。在特征提取时不妨不指定提取的何种特征而是直接交给神经网络进行特征提取提取所需要的特征可采用类似于DenseNet的连接方式来提取特征这样及考虑到了深层特征也考虑到了浅层特征也许对双眼视觉的特征提取有所帮助。然后是图像融合时这里采用的是加减cyc方法不妨尝试一下采用一个学习到的权重网络进行图像的融合这样也许能学习到更适合融合的权重和方法。再之后在S-SAE部分这种方法确实能够减少训练时间但是这有些限制了特征之间的交流和组合这里不妨尝试以下ShuffleMoblieNet的组合方法随机打乱分配以下特征网络的连接方式后面的加权局部质量的方法值得借鉴通过多个局部质量分数的融合也许能够得到更更好的质量分数。