Cross-Domain_Graph_Level_Anomaly_Detection---论文总结
一、核心问题
1、问题定义:
跨域图级异常检测:
源域:仅包含正常图
目标域:未标记图(含正常图与异常图)
目标:训练一个分类器,检测目标域中的异常图
2、研究动机:
传统图级异常检测方法多为无监督,依赖训练集全为正常图的强假设,一旦训练集混入异常,性能显著下降
实际中,某些领域可能有充足的标注数据,而目标域标注稀疏
现有UDA方法主要针对图像/文本,不适用于图结构数据,且假设源域包含所有类别,不适用于异常检测(源域仅有一类)
二、关键技术:ARMET方法
ARMET 是一种基于对抗域适应的图级异常检测方法,包含四个核心组件:
1、组件一:特征提取器
特征提取器的主要功能:把一个抽象的图转换成一个计算机能处理、包含丰富信息的特征向量。这个向量不仅要包含图本身的信息(语义和拓扑),还要包含这个图在整个图集中的相对位置信息。
语义特征提取器:
使用GIN模型,通过多层网络,不断聚合每个节点及其邻居的信息,局部理解图的局部和全局结构,当每个节点都有了丰富的特征之后,使用一个READOUT函数(比如取所有节点特征的平均值、最大值、总和)将这些节点的特征浓缩成单一的、固定长度的向量。这个向量就代表了整个图的语义和拓扑信息
结构特征提取器:
把源域中的每一个图看作一个点。计算所有图点两两之间的距离(用他们的语义特征向量计算欧式距离),为每个图点找到距离最近的k个邻居,并用边连接起来,这样就形成了一个全新的、以图为节点的图之图,把这个KNN图再次输入到另一个GIN模型中(但是这个GIN不需要READOUT)GIN会为KNN图中的每个节点学习一个表示。这个表示就编码了该图在整个图集中的结构上下文信息
特征拼接:
将语义特征向量和结构特征向量首尾相连,拼接成一个更长的向量,让最终的特征表示同时具备语义和结构这两类信息
2、组件二:对抗域分类器
对抗域分类器的主要功能:通过对抗训练,迫使组件一特征提取器提取的图的特征向量让对抗域分类器无法区分其是源域还是目标域,这样就可以抹除特征中的域的身份信息,使源域和目标域的特征分布尽可能对齐,从而使在源域中学到的知识能更好的迁移到目标域。
( 举例:比如在图像分类任务中,源域是在晴天拍摄的猫的图片,目标域是在阴天拍摄的猫的图片还有一些狗的图片,对抗域分类器的目的就是让模型只提取与猫有关的特征,而不是提取一些天气的特征。)
具体流程:特征提取器生成一个图的特征向量,将这个向量输入域分类器,域分类器输出一个概率值,表示它认为这个图来自目标域的信心,之后使用二分类交叉熵损失函数,计算损失,域分类器的目标是最小化这个损失,也就是要猜对,而特征提取器的目标是最大化这个损失,也就是生成让域分类器犯错的特征(也就是提取与域无关的特征,使源域和目标域特征分布对齐),这样就形成一种对抗或博弈,最终,特征提取器被迫学习那些对两个域都通用的、与域无关的本质特征。

3、组件三:单类分类器
主要功能:在源域的正常数据上,学习一个“正常”的概念,他试图在特征空间中画一个“包围圈”,把所有正常的图都包在里面。理想情况下,异常的图会落在这个圈子外面
工作流程:在特征空间中预先定义一个中心点,让所有源域正常图的特征向量都尽可能地靠近这个中心点(能提炼出所有正常图的共性特征,形成 “正常模式” 的基准),损失函数是,所有源域图特征到中心点的平均距离,在训练过程中,损失函数会拉扯特征,让正常样本聚集,在推理时,可以直接计算目标域图的特征到这个中心点的距离。距离远的就是异常,距离近的就是正常。同时,它也为类对齐器提供了目标域图的初始伪标签。

4、组件四:类别分类器
解决过渡对齐问题,仅仅让两个域的特征分布一致,可能会导致目标域中正常和异常的图混在一起,无法区分。对齐的任务是:在实现域对齐的同时,确保目标域内的类别可分性。
实现流程:分别计算源域正常类、目标域中被预测正常类、目标域中被预测异常的特征向量的平均中心点。计算对齐损失,损失函数包括两项,前一项希望源域和目标域的正常类中心尽可能接近,后一项希望目标域内部的正常和异常类中心尽可能远离,这是一个动态过程。一开始伪标签可能不准,但随着特征提取器和一类分类器越来越准,伪标签也越来越可靠,类对齐的效果就越来越好,形成一个正向循环。

三、实验验证
数据集:
-
系统日志图:HDFS、BGL、SPIRIT、THUNDERBIRD
-
字母绘图图:LL、LM、LH(不同扭曲程度)
对比方法:
-
无监督图异常检测方法:OCGIN、GLAM、GLocalKD
-
传统域适应方法:ADDA、CDAN、DeepCoral
-
监督方法(上界):iGAD
评估指标:
-
AUC ROC、AUC PR、F1-Score
主要结论:
-
ARMET 在 18 个跨域任务中的 13 个上取得最佳性能。
-
显著优于传统 UDA 方法(后者在源域仅有一类时性能接近随机猜测)。
-
各组件均对性能有正向贡献(见消融实验)。
-
对超参数(如嵌入维度、GIN 层数、KNN 的 k)具有一定鲁棒性。
四、总结:创新点与局限性
✅ 创新点:
-
首次提出跨领域图级异常检测问题,并给出解决方案。
-
提出 ARMET,结合 GNN 与对抗域适应,适用于源域只有正常图的场景。
-
引入结构特征提取器和类别对齐器,提升跨域表示的对齐与判别能力。
-
在多个真实数据集上验证了方法的有效性。
❌ 局限性:
-
领域相关性依赖强:若源域与目标域不相关,可能导致负迁移。
-
超参数调优复杂:需平衡三个损失项的权重,调参成本高。
-
伪标签质量依赖强:类别对齐依赖于单类分类器生成的伪标签,初始误差可能累积。
-
未量化可迁移性:缺乏对“领域相关性”的量化评估指标。
五、疑惑
1、为什么要有组件四:
为了防止特征提取器在“欺骗”域分类器的过程中,找到一种“作弊”的、破坏性的解决方案,即“过度对齐”。
设想一个“作弊”的场景:
-
任务:教一个AI在(源域)欧洲家和(目标域)日本家中都能识别猫。
-
组件二(域分类器):强烈要求特征提取器忽略“欧洲风格”和“日本风格”的家具背景。
-
特征提取器的“作弊”解法:它发现,如果它不仅模糊了背景,还把猫和狗的特征也混合在一起,生成一种“四不像”的特征,那么域分类器会更加难以判断这张图片是来自欧洲还是日本。因为现在两个域的图片特征都变成了一团混乱的“动物特征浆糊”,分布自然高度一致。
-
结果:组件二的目标被超额完成了(域分类器完全失效),但核心任务彻底失败了(AI再也分不清猫和狗)。
在技术层面,这种“作弊”解法就表现为:目标域的正常图和异常图在特征空间中被对齐并混合在了一起。
2、组件四利用组件三生成的伪标签来使源域和目标域正常类接近,使目标域的正常类和异常类远离,在初始阶段,组件三生成的伪标签正确率较低,不会产生影响吗
在训练初期,类对齐器损失 L_CA 的权重 λ3 可以被设置得相对较低,这意味着L_SC(一类分类器)和 L_DA(域分类器)损失占据主导,它们负责搭建一个初步的、相对稳健的特征空间骨架。L_CA 在初期更像一个“温和的指导”,而不是“强制的命令”。即使它的信号有噪声,由于权重小,也不会对模型造成颠覆性的影响。随着训练进行,当一类分类器趋于稳定,伪标签质量提高后,可以(隐式或显式地)增加 L_CA 的“话语权”,让它进行更精细的调整。
更多推荐

所有评论(0)