• 论文解读《Deep Attention-guided Graph Clustering with Dual Self-supervision》


    论文信息

    论文标题:Deep Attention-guided Graph Clustering with Dual Self-supervision
    论文作者:Zhihao Peng, Hui Liu, Yuheng Jia, Junhui Hou
    论文来源:2022, arXiv
    论文地址:download 
    论文代码:download 

    1 Introduction

      当前考虑拓扑结构信息和语义信息的深度聚类方法存在的问题:

      • 将 DAE 和 GCN 提取到的特征重要性同等看待;  
      • 忽略了不同层次的多尺度信息;  
      • 没有充分利用从 cluster 中的可用信息;  

    2 Method

      总体框架:

      

      组成部分:

      • a heterogeneity-wise fusion (HWF) module  
      • a scale-wise fusion (SWF) module  
      • a distribution-wise fusion (DWF) module  
      • a soft self-supervision (SSS) strategy  
      • a hard self-supervision (HSS) strategy  

      由于聚类任务没有真实标签作为监督信息,所以采用 Student’s t-distribution QQ 用来度量特征 hihi 和其质心 μjμj 的相似性:

        qi,j=(1+hiμj2/α)α+12j(1+hiμj2/α)α+12(1)qi,j=(1+hiμj2/α)α+12j(1+hiμj2/α)α+12(1)

      为了进一步提高置信度,求目标分布 B

        bi,j=q2i,j/iqi,jjq2i,j/iqi,j

      然后最小化两个分布之间的距离:

        minKL(B,Q)=ijbi,jlogbi,jqi,j(2)

    2.1 (HWF)Heterogeneity-wise Fusion module

      深度自动编码器(DAE)和图卷积网络(GCN)可以分别提取节点内容特征和拓扑结构特征。然而,以往的研究将从DAE和GCN中提取的特征的重要性等同起来,这在一定程度上是不合理的。为此,如 Figure 2 的左边界所示,我们提出了一个异构融合(HWF)模块来自适应地集成DAE和GCN特征,以学习区分特征嵌入。 

      

      利用深度自编码器(DAE)提取潜在表示,重构损失如下:

        LR=XˆX2F s.t. {Hi=ϕ(WeiHi1+bei)ˆHi=ϕ(WdiˆHi1+bdi),i=1,,l}(3)

      其中:

      • XRn×d 代表了原始数据(raw data);  
      • ˆXRn×d 代表了重构数据( reconstructed data);  
      • HiRn×di 代表了 Encoder 第 i 层的输出;  
      • ˆHiRn׈di 代表了 Decoder 第 i 层的输出;  
      • ϕ() 代表了激活函数,如 Tanh, ReLU ;    
      • Weibei 代表了 Encoder 第 i 层的权重参数和偏置项;  
      • Wdibdi 代表了 Dncoder 第 i 层的权重参数和偏置项;  
      • ˆHl 代表了重构后的 ˆX ;  
      • ZiRn×di 代表了 GCN 从第 i 层学到的特征;  
      • Z0H0 代表原始数据 X ;  

      学习相应的注意力系数:

      • 将  Zi  和  Hi  先进行拼接;
      • 将上述拼接的 [ZiHi]Rn×2di  ,进行全连接操作;  
      • 将上述结果使用激活函数 LeakyReLU ;  
      • 最后再使用 softmax function 和 2  normalization;  

      可以公式化为 :

        Mi=2(softmax(( LeakyReLU ([ZiHi]Wai))))(4)

      其中:

      • Mi=[mi,1mi,2]Rn×2 是 attention coefficient matrix  ,且 每项大于 0;
      • mi,1 mi,2 是衡量 ZiHi 重要性的权重向量;

      融合第 i 层的 GCN 的特征 Zi 和  AE 的特征  Hi

        Zi=(mi,11i)Zi+(mi,21i)Hi(5)

      其中:

      • 1iR1×di 代表着全 1 向量;
      • 代表着  Hadamard product  ;

      将上述生成的  ZiRn×di  当作第 i+1 层 GCN 的输入,获得 Zi+1  :

        Zi+1= LeakyReLU (D12( A+I)D12ZiWi)(6

      其中

      • GCN 原始模型中的邻接矩阵 A 变形为 D12(A+I)D12
      • IRn×n

    2.2 (SWF)Scale-wise Fusion

      将  multi-scale features Zi  拼接在一起。

        Z=[Z1ZiZlZl+1]

      其中:

      • Zl+1=HlRn×dl  表示  Zl+1  的信息只来自自编码器。

      将上述生成的 Z 放入全连接网络,并使用   softmax- 2  标准化:

        U=ΥA(Ξl+1j=1ZjWs)(7)

      即:

        U=2(softmax(LeakyReLU([Z1ZiZlZl+1]Ws)))

      其中:

      • U=[u1uiulul+1]Rn×(l+1)  且每个数大于 0
      • ui  代表了  Zi  的  parallel attention coefficient ;

      为了进一步探究多尺度特征,考虑在 attention 系数上施加一个相应的权重:

        Z=Ξl+1j=1((uj1j)Zj)(8)

      即:

        Z=[(u111)Z1(ui1i)Zi(ul1l)Zl(ul+11l+1)Zl+1]

      Z 将作为最终预测的输入,预测输出为 ZRn×k ,其中  k 代表聚类数。 

        Z=softmax(D12( A+I)D12ZW) s.t. kj=1zi,j=1,zi,j>0(9)

    2.3 (DWF)Distribution-wise Fusion

      

      分布 ZQ 分别由 Eq.9Eq.1 得到,它们在表示数据的内在结构和聚类分配方面存在其优缺点。因此,同时考虑这两种分布能够更好地利用潜在的鉴别信息来提高性能。所以,我们提出了一种新的分布级融合(DWF)模块来自适应地利用 ZQ 来生成最终的聚类结果。Figure 3 显示了整个体系结构。

        V=[v1v2]=ΥA([ZQ]ˆW)(10)

      其中 VRn×2 为注意系数矩阵,ˆW 是通过全连接层学习的权矩阵。

      然后,我们自适应地利用 ZQ

        F=(v11)Z+(v21)Q(11)

      其中,1R1×k 表示全 1 向量。最后,我们应用 softmax 函数将 F 归一化

        F=softmax(F)s.t.kj=1fi,j=1,fi,j>0(12)

      当网络经过良好的训练时,我们可以通过 F 直接推断出预测的聚类标签,即:

        yi=argmaxjfi,j s.t. j=1,,k(13)

      其中,yixi 的预测标签。这样,集群结构就可以显式地用 F 来表示。

    2.4 Dual Self-supervision

    2.4.1 Soft Self-supervision 

      由于我们利用高置信度分配,利用软赋值(即概率分布 QZ )迭代地细化聚类,因此我们将这种监督策略称为软自监督(SSS)策略。具体地说,由于 Z 通过 HWFSWF 模块涉及丰富的信息。

      我们首先通过平方 zi,j,推导出一个辅助分布 P,即:

        pi,j=z2i,j/ni=1zi,jkj=1z2i,j/ni=1kj=1zi,j(14)

      然后,我们使用一个高度一致的分布对齐来训练我们的模型:

        LS=λ1(KL(P,Z)+KL(P,Q))+λ2KL(Z,Q)=λ1nikjpi,jlogp2i,jzi,jqi,j+λ2nikjzi,jlogzi,jqi,j,(15)

    2.4.2 Hard Self-supervision

      为了进一步利用聚类分配中可用的鉴别信息,我们引入了伪监督技术[45],并将伪标签 ˆyi 设置为 ˆyi=yi。考虑到伪标签可能包含许多不正确的标签,我们通过一个较大的阈值 r 来选择高可信度的标签作为监督信息,即:

        gi,j={1 if fi,jr0 otherwise (16)

      在实验中,我们设置 r=0.8。然后,我们利用高置信度的伪标签来监督网络训练,即:

        LH=λ3ijgi,jΥCE(fi,j,ΥOH(ˆyi))(17)

      其中,λ3>0 为权衡参数,ΥCE 为交叉熵损失,ΥOHˆyi 转换为 one-hot 形式。如 Figure 4 所示,伪标签将集群分配转移到硬单热编码中,因此我们将其命名为硬自我监督(HSS)策略。

      组合 Eq.3Eq.15Eq.17,我们的整体损失函数可以写成

        L=minF(LR+LS+LH)(18)

      整个训练过程如 Algorithm 1 所示:

       

    3 Experiments

    数据集

      

    实验补充

      对于非图数据集(即 USPS、Reuters 和 HHAR)缺乏拓扑图,使用了一种典型的图构造方法来生成它们的图数据。具体来说,我们首先利用余弦距离来计算相似度矩阵 S,即:

        S=XXXFXF(19) 

      式中,XF=ni=1dj=1|xi,j|2X 分别表示 F 范数和 X 的转置运算。然后,我们保留每个样本的 topˆk 近邻,以构造一个无向的 ˆk-近邻(KNN)图。所构造的 KNN 图可以描述数据集的拓扑结构,因此被用作GCN输入。

    聚类结果

      

    消融实验

      

    参数分析

      

    4 Conclusion

      我们提出了一种新的深度嵌入聚类方法,同时增强了嵌入学习和聚类分配。具体来说,我们首先设计了异质性和尺度上的融合模块来自适应地学习判别表示。然后,我们利用分布融合模块,通过基于注意力的机制实现聚类增强。最后,我们提出了一种具有库回-莱布勒散度损失的软自我监督策略和一种具有伪监督损失的硬自我监督策略来利用聚类分配中现有的鉴别信息。定量和定性的实验和分析表明,我们的方法始终优于最先进的方法。我们还提供了全面的消融研究来验证我们的网络的有效性和优势。今后,我们将研究先进的图构造方法。


    __EOF__

  • 本文作者: Blair
  • 本文链接: https://www.cnblogs.com/BlairGrowing/p/16271177.html
  • 关于博主: 评论和私信会在第一时间回复。或者直接私信我。
  • 版权声明: 本博客所有文章除特别声明外,均采用 BY-NC-SA 许可协议。转载请注明出处!
  • 声援博主: 如果您觉得文章对您有帮助,可以点击文章右下角推荐一下。
  • 相关阅读:
    LiveData源码赏析 —— 基本使用
    晚上弱光拍照不够清晰,学会这几招画面清晰效果好
    数据结构-leetcode-移除元素
    JAVASE语法零基础——抽象类和接口
    6.S081环境配置-问题解决
    【Jenkins打包服务,Dockerfile报错:manifest for java : 8 not fourd】
    使用robot+selenium创建一个UI自动化测试用例
    Linux设置网络代理
    Kafka 杂谈
    Android Fragment动画实现
  • 原文地址:https://www.cnblogs.com/BlairGrowing/p/16271177.html