多模态机器学习
什么是多模态机器学习🍌
每一种信息的来源或者形式,都可以称为一种模态。例如,人有触觉,听觉,视觉,嗅觉;信息的媒介有语音、视频、文字等;多种多样的传感器,如雷达、红外、加速度计等。
同时,模态也可以有非常广泛的定义,比如我们可以把两种不同的语言当做是两种模态,甚至在两种不同情况下采集到的数据集,亦可认为是两种模态。
因此,多模态机器学习,英文全称 MultiModal Machine Learning (MMML),旨在通过机器学习的方法实现处理和理解多源模态信息的能力。目前比较热门的研究方向是图像、视频、音频、语义之间的多模态学习。
多模态学习的分类
多模态学习可以划分为以下五个研究方向:
1.多模态表示学习 Multimodal Representation
2.模态转化 Translation
3.对齐 Alignment
4.多模态融合 Multimodal Fusion
5.协同学习 Co-learning
多模态表示学习🍏
单模态的表示学习负责将信息表示为计算机可以处理的数值向量或者进一步抽象为更高层的特征向量,而多模态表示学习是指通过利用多模态之间的互补性,剔除模态间的冗余性,从而学习到更好的特征表示。主要包括两大研究方向:联合表示(Joint Representations)和协同表示(Coordinated Representations)。
1.联合表示:将多个模态的信息一起映射到一个统一的多模态向量空间;
2.协同表示:将多模态中的每个模态分别映射到各自的表示空间,但映射后的向量之间满足一定的相关性约束(例如线性相关)。
模态转化🍎
转化也成为映射,负责将一个模态的信息转换位另一个模态的信息。常用的应用包括:机器翻译,唇语和语音翻译;图片描述,视频描述;语音合成等。
模态间的转换有两个难点:
1.open-ended,即未知结束位,例如在实时翻译中,在未获得句尾的情况下,必须实时的对句子进行翻译。
2.subjective,即主观评判性,是指很多模态转换问题的效果没有一个比较客观的评判标准,也就是说目标函数的确定是非常主观的。例如,在图片描述中,形成怎样的一段话才算是对图片好的诠释?也许一千个人心中有一千个哈姆雷特。
对齐 Alignment🍐
多模态的对齐负责对来自同一个实例的不同模态信息的子分支/元素寻找对应关系。比如电影画面-语音-字幕的自动对齐。
对齐又可以是空间维度的,比如图片语义分割 (Image Semantic Segmentation):尝试将图片中的每个像素对应到某一种类型标签,实现视觉-词汇对齐。
多模态融合 Multimodal Fusion🍊
多模态融合(Multimodal Fusion )负责联合多个模态的信息,进行目标预测(分类或者回归)。
按照融合的层次,可以将多模态融合分为 pixel level,feature level 和 decision level 三类,分别对应对原始数据进行融合、对抽象的特征进行融合和对决策结果进行融合。而 feature level 又可以分为 early 和 late 两个大类,代表了融合发生在特征抽取的早期和晚期。当然还有将多种融合层次混合的 hybrid 方法。
视觉-音频识别(Visual-Audio Recognition): 综合源自同一个实例的视频信息和音频信息,进行识别工作。
多模态情感分析(Multimodal sentiment analysis): 综合利用多个模态的数据(例如下图中的文字、面部表情、声音),通过互补,消除歧义和不确定性,得到更加准确的情感类型判断结果。
多模态融合研究的难点主要包括如何判断每个模态的置信水平、如何判断模态间的相关性、如何对多模态的特征信息进行降维以及如何对非同步采集的多模态数据进行配准等。
协同学习 Co-learning🍋
协同学习是指使用一个资源丰富的模态信息来辅助另一个资源相对贫瘠的模态进行学习。比如迁移学习
迁移学习比较常探讨的方面目前集中在领域适应性(Domain Adaptation)问题上,即如何将train domain上学习到的模型应用到 application domain。
迁移学习领域著名的还有零样本学习(Zero-Shot Learning)和一样本学习(One-Shot Learning),很多相关的方法也会用到领域适应性的相关知识。
Co-learning 中还有一类工作叫做协同训练(Co-training ),它负责研究如何在多模态数据中将少量的标注进行扩充,得到更多的标注信息。