一、论文基本信息论文题目Multimodal Deep Learning作者Jiquan Ngiam、Aditya Khosla、Mingyu Kim、Juhan Nam、Honglak Lee、Andrew Y. Ng发表会议ICML 2011研究模态音频与视频研究任务视听语音识别、跨模态特征学习、共享表示学习这篇论文发表于2011年模型主体仍然是受限玻尔兹曼机、深度信念网络和深度自编码器。虽然这些结构现在已经不再是多模态研究的主流但论文提出的问题却一直延续到了今天不同模态应该如何融合一个模态能否帮助另一个模态学习更好的表示不同模态能否映射到统一的语义空间当某个模态缺失时模型能否继续工作论文以音频和嘴部视频为研究对象系统讨论了多模态融合、跨模态学习和共享表示学习三种基本设置是深度多模态表示学习领域的早期代表性工作。二、论文要解决什么问题在视听语音识别中同一句话可以同时通过两种方式被观察音频记录说话者发出的声音视频记录嘴唇的形状和运动。音频和视频描述的是同一个发音过程但两者的数据形式完全不同。音频通常表示为波形或频谱视频则由连续图像帧组成。原始频谱数值与嘴部像素之间并不存在直接的一一对应关系真正的联系出现在更高层的语义结构中音频中的音素模式视频中的嘴型和嘴部运动音素与嘴型之间的对应关系。论文将这种关系称为一种“中层相关性”。模型不能只在原始音频和原始像素之间进行简单匹配而需要先学习每个模态的中层表示再建立不同模态之间的关联。论文的核心目标可以概括为利用深度网络从音频和视频中学习联合表示使不同模态能够相互补充、相互监督并在一定程度上共享语义空间。三、为什么多模态学习不能只是简单拼接最直接的多模态融合方式是分别提取音频特征和视频特征然后将两者拼接起来送入分类器。音频特征和视频特征虽然被放入了同一个向量但这并不意味着模型真正理解了两种模态之间的关系。简单拼接主要存在三个问题。1. 没有显式建立跨模态对应关系拼接操作只是在特征维度上进行组合并没有告诉模型哪种嘴型对应哪种声音哪些视觉变化与发音有关哪些视觉信息只是背景或个体外观哪些音频与视觉特征表达相同的语义。2. 不同模态的判别能力并不相同在干净环境中音频通常已经足以完成语音分类。此时直接加入较弱的视频特征可能增加噪声反而降低识别效果。3. 跨模态关系通常是非线性的音频频谱和嘴部像素之间不存在简单的线性映射。只有先经过非线性特征提取将原始数据转化为音素、嘴型等中层表示模型才更容易发现不同模态之间的关系。论文的实验也表明简单拼接音频特征与视频特征并不一定优于单独使用音频真正有效的是学习能够补充音频信息的多模态表示。四、论文定义的三种多模态学习设置这篇论文最重要的贡献之一是将多模态学习过程划分为三个环节无监督特征学习有监督分类器训练模型测试。根据三个环节中可用模态的不同论文定义了三种学习设置。学习设置特征学习分类器训练测试研究目标多模态融合音频视频音频视频音频视频综合利用不同模态跨模态学习音频视频单一模态同一单一模态利用辅助模态改善目标模态表示共享表示学习音频视频一种模态另一种模态检验表示是否具有模态不变性这三种设置看起来相近但研究的问题并不相同。五、多模态融合同时使用音频和视频多模态融合是最常见的设置。在特征学习、分类训练和测试时音频与视频都可以使用。例如在语音识别中音频提供频率、音调和发音内容视频提供嘴唇形状、发音位置和嘴部运动两者共同完成识别。这种方法的优势主要出现在某个模态受到干扰时。当音频清晰时视频可能只能提供有限的额外信息当音频受到噪声影响时嘴部视频就可以帮助模型区分声音相近但发音位置不同的内容。因此多模态融合并不是“模态越多越好”而是要看新模态是否能够提供与原有模态互补的信息。六、跨模态学习训练时使用多个模态测试时只使用一个模态跨模态学习中音频和视频只在无监督特征学习阶段同时出现。以视觉唇读为例环节可用数据特征学习音频视频分类器训练只有视频测试只有视频这里的研究问题是即使部署时不能使用音频训练阶段加入音频能否帮助模型学习更好的视频表示音频在最终推理时并不存在而是作为训练阶段的辅助监督。普通视频自编码器只需要根据视频恢复视频因此可能保留大量与语音内容无关的信息例如人脸纹理光照变化说话者外观背景变化摄像机噪声。如果模型不仅要根据视频重构视频还要根据视频预测对应音频那么视频表示就必须重点保留与发音相关的信息例如嘴巴开合、唇部运动和发音时序。因此音频在这里相当于一个训练期的“教师模态”帮助视频模型过滤无关视觉信息。七、共享表示学习在一种模态上训练在另一种模态上测试共享表示学习比跨模态学习更加严格。以“听声音学习通过嘴型测试”为例环节可用数据特征学习音频视频分类器训练只有音频测试只有视频分类器在训练时只学习数字“1”“2”“3”听起来是什么样测试时却要根据嘴部视频判断说的是哪个数字。论文将这种设置形象地称为Hearing to See即“通过听来学习再通过看来识别”。反向设置则是Seeing to Hear即“通过看来学习再通过听来识别”。如果模型能够完成这种任务说明音频与视频在特征空间中已经形成了一定程度的共享表示。这一设置与今天的跨模态检索、零样本迁移和统一嵌入空间非常相似。八、模型基础稀疏受限玻尔兹曼机论文使用稀疏受限玻尔兹曼机也就是Sparse RBM作为深度网络的基础模块。RBM包含两类变量可见变量用来接收输入数据隐藏变量用来学习潜在特征。给定输入 v隐藏单元的激活概率可以写为其中表示输入到第 j个隐藏单元的权重是偏置用于控制高斯可见变量的尺度。论文还对隐藏单元增加稀疏约束使大部分隐藏单元在一个样本上保持不激活只有少量单元响应特定的声音或嘴型模式。从现代视角理解RBM在本文中的作用类似于一个无监督编码器音频RBM负责学习音频特征视频RBM负责学习嘴部运动特征高层网络负责学习两个特征空间之间的关系。九、从浅层模型到深层多模态表示论文没有直接给出最终模型而是从几种基础结构逐步说明为什么需要深度多模态自编码器。1. 分别训练音频和视频RBM最简单的方法是为音频和视频分别训练一个RBM。音频经过音频RBM得到音频表示视频经过视频RBM得到视频表示。这种方法能够学习单模态特征但两个模型彼此独立无法发现音频与视频之间的对应关系。2. 浅层双模态RBM第二种方法是将音频和视频同时输入一个RBM使两种模态共享同一层隐藏单元。理论上共享隐藏层应该同时响应声音和嘴型。但论文发现浅层双模态RBM学到的隐藏单元通常只连接一个模态一部分单元主要响应音频另一部分单元主要响应视频真正同时连接音频和视频的单元很少。这是因为原始音频频谱与原始视频像素之间的关系过于复杂单层非线性变换很难直接发现这种中层对应关系。3. 双模态深度信念网络为了解决浅层模型的问题论文首先分别训练音频和视频的底层表示然后在两个底层表示之上训练新的共享层。这一过程可以理解为音频输入经过底层网络得到类似音素的表示视频输入经过底层网络得到类似嘴型的表示高层网络再学习音素与嘴型之间的对应关系。论文认为跨模态关系在经过一层非线性转换以后会更容易学习。第一层负责消除原始模态形式上的巨大差异第二层负责发现更高层的语义关联。但是双模态深度信念网络仍然存在两个问题第一它没有显式要求模型一定要学习跨模态关系。模型仍然可能分别使用一组单元处理音频另一组单元处理视频。第二当测试时缺少一个模态需要对未观察模态进行概率推断使用起来比较复杂。因此作者进一步提出了深度自编码器结构。十、核心模型一Video-Only Deep AutoencoderVideo-Only Deep Autoencoder可以翻译为“仅视频输入的深度自编码器”。需要注意这个模型并不是只重构视频而是输入只有视频输出同时重构视频和音频。设视频输入为 v编码器产生中间表示然后使用两个解码分支分别重构视频和音频模型的训练目标可以简化表示为第一项要求模型保留视频自身的信息第二项则要求视频表示包含能够预测音频的信息。这意味着隐藏表示不能只记住嘴唇颜色、人脸纹理和背景而必须保留与发音真正相关的嘴部动作。论文也将这一模型视为一种多任务学习一个任务是视频重构另一个任务是跨模态音频重构两个任务共享同一个视频编码器。这一设计体现了论文最重要的思想之一辅助模态不一定要在部署时出现它也可以只在训练阶段为目标模态提供监督。十一、核心模型二Bimodal Deep AutoencoderVideo-Only Deep Autoencoder只适用于视频输入。如果希望一个模型同时支持以下情况只有音频只有视频音频和视频同时存在就需要训练一个更加统一的模型。论文为此提出Bimodal Deep Autoencoder即双模态深度自编码器。模型同时接收音频和视频并通过共享中间层重构两种模态。为了让模型能够适应模态缺失作者构造了三类训练样本训练样本类型音频输入视频输入重构目标完整多模态样本有有音频视频音频单模态样本有置零音频视频视频单模态样本置零有音频视频三种样本各占训练数据的大约三分之一。即使输入中缺少一个完整模态模型仍然需要重构音频和视频。这种方法与去噪自编码器非常相似。普通去噪自编码器随机破坏部分输入再要求模型恢复原始数据本文则直接删除完整模态再要求模型根据剩余模态恢复全部信息。从今天的视角看这种方法可以被理解为早期的模态级Dropout缺失模态学习跨模态补全多模态去噪训练掩码模态建模。十二、完整训练流程论文的训练过程可以概括为以下几个环节。1. 音频预处理音频被转换为频谱并加入时间差分特征。每个音频帧最初为483维经过PCA白化降至100维。模型每次使用连续10个音频帧作为输入。2. 视频预处理视频首先提取嘴部区域将嘴部图像统一缩放至 (60\times80)然后通过PCA白化降至32维同时加入时间差分特征。模型每次输入4个连续视频帧其时间长度与10个音频帧大致对应。3. 单模态RBM预训练分别训练音频RBM和视频RBM让两个模态先学习各自的底层表示。4. 高层联合表示学习将音频和视频的底层特征组合起来在其上训练新的共享隐藏层。5. 展开为深度自编码器利用RBM参数初始化编码器和解码器并通过重构误差进行整体微调。6. 提取中间层特征训练完成后取自编码器中间层作为新的音频、视频或多模态表示。7. 使用线性SVM完成分类论文最终使用简单的线性SVM进行字母和数字分类。这样做的目的是让实验结果主要反映特征表示的质量而不是复杂分类器带来的性能差异。十三、实验数据集论文使用了多个视听语音数据集进行无监督特征学习和有监督分类。1. CUAVECUAVE包含36位说话者每人朗读数字0到9每个数字重复5次。论文使用正面说话的正常视频部分并采用说话者独立划分偶数编号说话者用于训练奇数编号说话者用于测试。2. AVLettersAVLetters包含10位说话者每人朗读字母A到Z每个字母重复3次。该数据集提供提前提取的嘴部区域但没有原始音频因此主要用于纯视觉唇读实验。3. AVLetters2AVLetters2包含5位说话者每人朗读字母A到Z七次。论文只将其用于无监督特征学习。4. Stanford自建数据集作者另外采集了23名志愿者朗读数字、字母和部分句子的音视频数据用于无监督训练。5. TIMITTIMIT只包含语音论文使用它预训练音频特征。十四、实验一跨模态学习能否改善视觉唇读这一实验研究的问题是最终只有视频输入时特征学习阶段加入音频能否改善视频分类能力AVLetters实验结果特征表示分类准确率预处理视频特征46.2%视频RBM54.2%Video-Only Deep Autoencoder64.4%Bimodal Deep Autoencoder59.2%Local Binary Pattern58.85%Video-Only Deep Autoencoder达到64.4%明显高于只使用视频训练的RBM也超过了当时论文中列出的已有视觉特征方法。这说明即使AVLetters本身没有音频模型仍然可以利用其他数据集中的同步音频和视频学习跨模态关系再将这种表示迁移到纯视觉唇读任务。CUAVE视觉识别结果特征表示分类准确率预处理视频特征58.5%视频RBM65.4%Video-Only Deep Autoencoder68.7%Bimodal Deep Autoencoder66.7%在CUAVE上Video-Only Deep Autoencoder同样优于普通视频RBM。不过论文的方法没有超过所有已有系统。部分已有方法使用了更复杂的人脸跟踪、姿态校正和嘴部配准而本文只使用较简单的嘴部区域提取因此不同结果不能完全直接比较。为什么统一双模态模型不如视频专用模型一个值得注意的现象是Bimodal Deep Autoencoder在纯视觉任务中不如Video-Only Deep Autoencoder。原因在于视频专用模型只需要学习视频自身信息能够从视频预测音频的信息。而双模态模型需要同时表示音频特有信息视频特有信息两个模态共有的信息不同模态缺失时的补全能力。因此统一模型的表示容量被分配到了更多目标上不一定最适合纯视觉分类。论文也明确指出通用双模态表示不一定是单模态任务上的最优表示。这一现象至今仍然存在表示越通用不代表它在每个具体任务上都一定优于专用表示。十五、实验二多模态融合是否能提高抗噪能力论文在CUAVE上分别测试了干净音频和加入0 dB高斯白噪声的音频。特征表示干净音频噪声音频Audio RBM95.8%75.8%Video-Only Deep Autoencoder68.7%68.7%Bimodal Deep Autoencoder90.0%77.3%Bimodal特征Audio RBM94.4%82.2%Video特征Audio RBM87.0%76.6%在干净环境下音频本身已经具有很强的判别能力Audio RBM达到95.8%。加入双模态表示后准确率反而略有下降。但在噪声环境下纯音频特征为75.8%普通视频与音频组合为76.6%学习到的双模态特征与音频特征组合达到82.2%。这说明视频信息在音频受到破坏时具有明显的补充作用但简单拼接并不能充分发挥这种优势。模型需要学习与音频真正互补的多模态表示。这个实验得到三个重要结论。第一多模态信息并不总是有益当一个模态已经足够可靠时加入较弱模态可能产生负迁移。第二多模态优势通常在单模态退化时更加明显噪声使音频信息不可靠后视觉信息的价值才充分体现出来。第三学习融合比简单拼接更加重要直接组合音频和视频特征只是将不同信息放在一起双模态表示学习则尝试提取二者真正互补的部分。十六、实验三模型是否表现出麦格克效应麦格克效应是一种经典的视听语音感知现象。当人看到的嘴型像是在说/ga/但听到的声音是/ba/时很多人会感知成/da/。作者使用23名志愿者朗读/ga/、/ba/和/da/并用双模态深度自编码器特征训练三分类器。视觉与音频组合预测为/ga/预测为/ba/预测为/da/视觉/ga/音频/ga/82.6%2.2%15.2%视觉/ba/音频/ba/4.4%89.1%6.5%视觉/ga/音频/ba/28.3%13.0%58.7%当视觉输入和音频输入一致时模型大部分时间能够预测正确类别。当视觉输入为/ga/、音频输入为/ba/时模型有58.7%的概率预测为/da/。虽然输入中并没有出现/da/共享表示却产生了类似人类麦格克效应的分类结果。这说明模型并不是完全独立地处理音频和视频后进行简单投票而是在中间表示中形成了一定程度的跨模态交互。当然这一结果只能说明模型表现出了类似现象不能据此认为它具有与人类相同的认知机制。十七、实验四共享表示能否实现跨模态分类共享表示实验进一步提高了难度。模型在一种模态上训练分类器在另一种模态上进行测试。分类器训练模态测试模态方法准确率音频视频Raw-CCA41.9%音频视频RBM特征CCA57.3%音频视频Bimodal Deep Autoencoder30.7%视频音频Raw-CCA42.9%视频音频RBM特征CCA91.7%视频音频Bimodal Deep Autoencoder24.3%随机猜测准确率为10%。这个实验最值得注意的地方是最优结果并不是双模态深度自编码器而是“单模态RBM特征CCA”。CCA即典型相关分析负责寻找两组变量之间相关性最大的线性投影。在原始音频和视频上直接使用CCA效果已经明显高于随机猜测先使用RBM进行非线性特征提取再通过CCA进行线性对齐性能进一步大幅提高。论文据此得到一个重要判断音频与视频之间的关系至少需要经过一次非线性特征变换当两个模态都得到较好的中层表示后简单的线性方法也可以有效完成跨模态对齐。这一思想与现代双编码器非常接近视觉编码器负责将图像映射为高层表示文本或音频编码器负责将另一模态映射为高层表示对齐目标再将不同模态拉入共享空间。十八、控制实验性能提升究竟来自哪里为了判断Video-Only Deep Autoencoder的改进来自网络深度还是跨模态重构论文进行了两组控制实验。1. 去掉音频重构目标模型只根据视频重构视频不再预测音频。结果显示CUAVE准确率下降7.7个百分点AVLetters准确率下降14.3个百分点。这说明音频重构目标确实为视频表示提供了有效的跨模态监督。2. 将深度模型替换为浅层模型模型仍然从视频重构音频和视频但只使用一个隐藏层。结果显示CUAVE准确率下降2.1个百分点AVLetters准确率下降5.0个百分点。因此论文方法的有效性来自两个方面跨模态监督帮助模型提取更有语义的特征深层非线性结构帮助模型发现复杂的模态对应关系。十九、论文的核心贡献1. 系统区分三种多模态学习范式论文明确区分了多模态融合跨模态学习共享表示学习。这比单纯提出一个模型结构更有影响力因为这三类问题后来一直是多模态研究的重要组成部分。2. 证明辅助模态可以改善目标模态表示音频不需要出现在最终测试阶段也可以在特征学习阶段帮助视频学习更好的嘴型表示。这种思想与今天的跨模态蒸馏和训练期特权信息非常相似训练时使用更多模态部署时只保留成本较低或更容易获得的模态。3. 提出了缺失模态鲁棒训练方式论文随机删除完整音频或视频并要求模型重构两个模态。这种模态级去噪训练是后来Modality Dropout、缺失模态补全和掩码多模态学习的早期雏形。4. 尝试构建模态无关的共享空间通过“音频训练、视频测试”和“视频训练、音频测试”论文直接检验了表示是否能够跨模态迁移。这与现代跨模态检索和零样本迁移所依赖的共享嵌入空间具有相同的问题本质。5. 证明学习融合优于简单拼接实验表明直接增加模态并不一定提升性能。有效的多模态模型必须回答哪些信息是不同模态共有的哪些信息是相互补充的哪些信息只是模态特有噪声当模态质量变化时应该依赖哪个模态二十、论文带来的重要启示1. 多模态学习的核心不是模态数量而是模态关系模型同时输入音频和视频并不代表它真正完成了多模态学习。真正重要的是模型是否找到了共享语义一个模态能否预测另一个模态不同模态能否相互补充某个模态缺失后模型能否继续工作。2. 跨模态监督能够过滤单模态噪声普通视频重构会保留所有有助于恢复图像的信息。跨模态重构则会促使模型优先保留那些既能解释视频、又能预测音频的信息。因此音频实际上为视觉表示提供了一个语义筛选条件。3. 不同模态之间的帮助通常是不对称的论文发现音频能够明显改善视频表示但视频没有明显改善干净音频的分类效果。原因是音频本身对语音内容具有很强的判别能力而嘴型只能提供部分发音信息。现代多模态系统中同样存在这种不对称性。语言可以为视觉提供丰富语义但视觉未必能够以同样程度改善语言建模。4. 共享表示和任务专用表示之间存在权衡更合理的多模态表示应同时包含共享信息和模态特有信息共享部分负责模态对齐和跨模态迁移特有部分负责保留每种模态独有的判别信息。如果过度强调模态不变性模型可能丢失有价值的模态特有信息如果只保留模态特有信息则无法建立统一语义空间。二十一、论文的局限性1. 模型结构已经不再主流论文依赖RBM、深度信念网络、逐层贪心预训练和线性SVM。现代方法通常使用CNN、Transformer或端到端神经网络。不过模型结构过时并不影响论文提出的问题和学习范式。2. 数据规模较小实验主要是数字、字母和少量音节识别数据规模与现代互联网图文、长视频和大规模音频数据相差很大。因此论文证明的是方法思想而不是大规模开放场景中的通用性能。3. 依赖大量人工预处理视频需要提前检测嘴部区域并通过PCA压缩音频也需要转换为频谱并进行PCA白化。模型没有端到端学习人脸检测、嘴部定位、音频前端和多模态对齐。4. 重构目标可能保留过多低层信息完整重构音频和视频会要求模型保留大量输入细节而分类任务真正需要的可能只是高层语义。现代多模态方法更多采用对比学习图文匹配掩码预测文本生成指令微调。这些目标往往比像素或频谱重构更直接地面向语义。5. 共享表示模型并没有取得最优结果在跨模态分类中双模态深度自编码器明显低于RBM特征加CCA。这说明论文提出的统一自编码器虽然能够学习部分共享表示但还没有充分解决模态对齐与模态专用信息分离的问题。6. 缺失模态处理方式比较简单论文直接将缺失模态设为全零。这种方式与真实环境中的模态退化并不完全相同。现实中的音频可能是低信噪比视频可能是模糊、遮挡或丢帧而不一定完全消失。现代方法通常还会使用可学习的缺失模态标记模态掩码不确定性建模概率生成和补全不同程度的模态退化训练。二十二、与现代多模态模型的联系本文中的思想现代方法中的对应形式音频与视频独立编码模态专用编码器高层共享表示统一多模态嵌入空间视频预测音频跨模态预测与跨模态蒸馏随机删除完整模态Modality Dropout音频训练、视频测试跨模态零样本迁移RBM特征CCA双编码器对比学习双模态重构掩码多模态建模噪声音频下使用视频鲁棒多模态融合与CLIP的联系CLIP同样希望将不同模态映射到统一空间。本文主要通过跨模态重构和CCA建立联系而CLIP通过对比学习拉近匹配图像和文本推远不匹配图像和文本。两者使用的模型和训练目标不同但都在研究同一个基础问题不同模态如何形成可以相互比较的共享语义表示与多模态大模型的联系现代多模态大模型通常由视觉编码器、连接模块和大语言模型组成。它们不再重构原始图像而是通过文本生成、视觉问答和指令微调学习图像与语言的关系。不过本文提出的问题仍然没有消失不同模态应该在哪一层融合模型是否真正使用了视觉信息一个强模态是否压制了另一个模态某个模态缺失时模型是否稳定共享表示是否损害模态特有信息二十三、总结《Multimodal Deep Learning》的主要价值并不在于它提出了一套今天仍需直接使用的RBM模型而在于它较早系统回答了多模态学习中的三个基础问题。1. 多个模态能否提高任务性能可以但前提是不同模态具有互补信息并且模型能够学习有效的融合关系。简单拼接不一定有效。2. 一个模态能否帮助另一个模态学习可以。论文通过“输入视频、同时重构视频和音频”使音频成为视觉表示学习的辅助监督从而提高了纯视觉唇读性能。3. 不同模态能否进入共享语义空间可以达到一定程度。模型能够在一种模态上训练、在另一种模态上测试但实验也说明共享表示学习仍然比普通多模态融合更加困难。整篇论文最核心的思想可以概括为多模态学习不是把多种数据简单放在一起而是利用不同模态之间的关联学习能够保留共享语义、利用互补信息并支持跨模态迁移的表示。从后来的跨模态检索、对比学习到视觉语言预训练和多模态大模型这篇论文提出的问题始终处于多模态研究的核心位置。