论文题目(Title):Joint Multi-modal Aspect-Sentiment Analysis with Auxiliary Cross-modal
Relation Detection
研究问题(Question):多模态方面级情感分析(MALSA)
研究动机(Motivation):方面术语抽取(ATE)和方面情感分类(ASC)是方面级情感分析(ALSA)中两个基础的细粒度子任务。在文本分析中,联合提取方面术语和情感极性比单独的子任务具有更好的实用性。然而,在多模态场景下,现有研究局限于独立处理每个子任务,未能建模上述两个目标之间的固有联系,并忽略了更好的应用。
主要贡献(Contribution):文中首次联合执行了多模态ATE (MATE)和ASC (MASC),并提出了一种辅助跨模态关系检测的多模态联合学习方法用于多模态方面级情感分析(MALSA)。
研究难点:
一方面,视觉模态不一定对文本模态下的信息有拓展作用。因此,一个表现良好的方法应该确定视觉信息是否添加到文本模态中(跨模态关系检测)以及视觉信息对文本的贡献有多大。
另一方面,两个多模态子任务的特点不同:一个是序列标注问题,另一个是方面依赖分类问题。不同的任务似乎关注不同的图像信息(前者只用观察粗粒度的信息就可判断是文本中的具体的人,而后者需要观察更加细致的表情)。因此,一个良好的方法应该分别挖掘这两个子任务的视觉信息,而不是使用相同的视觉输入进行折叠标记。
研究思路(Idea):
研究方法(Method):

Task Definition
词嵌入是有BERT预先操作得到的,因为BERT对于文本表达的出色表现
同时图片嵌入是由ResNet预先操作得到的,因为ResNet在图像表达上有出色的表现
1)Cross-modal Relation Detection
这个模块的目的是为后面的联合任务探索有效的视觉信息,而不是想传统方法那样将所有的视觉信息都投入使用。
Module Design.
2)Multi-modal Aspect Terms Extraction
首先利用文本-图像关系控制视觉输入,使文本和视觉信息相互注意;
然后让文本信息考虑进高效的上一步得到的视觉信息
结束部分同理
3)Multi-modal Aspect Sentiment Classification
对于一个方面a,我们利用上述得到的位置标记可以确定位置范围 (si,ei) ,将其标记为 Ha (一个提取的方面词),我们利用注意力机制对其进行总结
将视觉表达结合到跨度向量
最后经过两个线性层和softmax得到最终分类概率
4)Joint Loss
因为是两个联合任务,因此计算了两个不同的损失
研究过程(Process):
1.数据集(Dataset)
2.评估指标(Evaluation):F1,精度(precision),召回(recall)
3.实验结果(Result)

总结(Conclusion):之前有工作提出将图像信息引入到方面级情感分析中,但这篇文章提出,将有用的信息引入,无用的信息筛掉,有可借鉴之处。