虽然f-VAEGAN-D2在题目中说“适用任意样本”,但对比的Few-shot相关的实验较少,这里仅讨论零样本学习的情况。
1. 背景介绍
由于为每个对象收集足够数量的高质量带标签样本难以实现,使用有限的标签进行训练学习一直是一个重要的研究方向。零样本学习(Zero-Shot Learning, ZSL)最初被称为计算机视觉中的零数据学习,目标是在标签受到极大限制的设置下,完成训练。在传统的ZSL中(或称为归纳零样本学习),没有为目标类提供训练示例,因此这些类被称为未见类。对于训练示例,是有着标签配对的大量训练样本,这些样本的类被称为可见类。传统零样本学习的核心挑战是:对于存在的相关知识,使分类器能够从可见类中提取的知识转移到未见类中。类别相关的信息一般以辅助信息的形式给出,作为可见类与未见类知识迁移的桥梁,辅助信息被编码为嵌入向量后使用,辅助信息可以是由人工标注的属性信息、文本描述、知识图谱或本体(Ontology)等。
对于未见类,仅使用辅助信息学习会导致未见类真实分布与建模分布之间存在差异,这被称为域转移问题。为了简化零样本学习,提出了转导零样本学习(Transductive Zero-Shot Learning, TZSL),它允许在训练中额外包含未见类的未标记样本。
在足够的数据样本示例支持下,使用生成模型学习数据点的概率分布,以便从中采样并合成示例,实现数据增强,帮助TZSL学习未见类的数据分布。
2. 方法
f-VAEGAN-D2

设置
- 对于一组图像
,编码在图像特征空间 中。 - 一个已见类别标签集
,一个新类的标签集 (也就是零样本学习中的未见类别标签集 )。 - 类别嵌入集合
(也就是描述图像的信息)编码在语义嵌入空间 中。 - 前
个样本 标记为已见类别 ,其余点 是未标记的,可能是已见或新类。
在归纳设置中,训练集仅包含已见类别图像的标记样本,即
在零样本学习中,任务是预测属于新颖类别的那些未标记点的标签,即
VAE与WGAN的损失函数
生成器
编码器
优化目标设置
图中的编码器
VAE的Decoder与GAN的Generator共享参数(也就是同一个模块两个名字,就像图中画出的);上标
而对于未见类,使用了无条件判别器
其中
的作用是满足梯度惩罚,保证 WGAN 符合 Lipschitz 连续性。 具体来说, 是通过对真实数据样本 进行微小的扰动得到的。用 控制扰动的大小。 通过在 周围加入一个小的扰动来近似数据分布的局部结构,从而鼓励判别器对数据的微小变化做出响应。这有助于使判别器在输入空间中是局部 Lipschitz 连续的,从而实现梯度惩罚。
Lipschitz连续定义:对于在实数集的子集的函数
,若存在常数 使得 ,则称 符合Lipschitz条件,对于 最小的常数 称为 的Lipschitz常数。[Source]
其他
图中的随机噪声没有解释,也许是测试发现的?)。同样,视觉特征和类嵌入串联后进入判别器。
3. 实验
论文中,对于合成的特征进行解释。图像特征通过上采样生成图片;文本解释通过训练的LSTM生成,LSTM根据图像的平均隐藏层生成类嵌入,得到合成特征的解释。

图展示了从真实特征和合成特征获得的解释。我们观察到该模型为可见类和未见类的合成特征生成图像相关和类特定的解释。例如,“King Protea”特征包含有关“红色花瓣和尖尖”的信息,而“Purple Coneflower”特征包含有关“粉红色和向下下垂的花瓣”的信息,这些特征是这种花在视觉上最显着的特征。
另一方面,如图底部所示,对于图像特征缺乏一定细节水平的类,生成的解释存在一些问题,例如重复,例如“喇叭形”和“星形”在同一个句子中和未知单词,例如参见“气球花(Balloon Flower)”的解释。
参考文献
- Xian, Yongqin, et al. "f-vaegan-d2: A feature generating framework for any-shot learning." Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 2019.