💡 核心创新点
多模态学习(MML)旨在融合来自语言、视觉和音频等多源信号,以获取互补的综合特征表示。然而,传统方法通常假设跨模态交互发生在单一语义层面上,直接将所有模态投影到同一个潜在空间进行早期或混合融合。这种粗暴融合忽略了多模态数据在特征深度上天然存在的异步多层级语义结构(Asynchronous Multi-Level Semantic Structure)。

为了打破“单层假设”引发的语义混淆与错误传播,本文提出了跨层级协同表示框架(Cross-Level Co-Representation, CLCR)。其核心创新性体现在以下三个方面:
- 显示三级语义层级构建: CLCR 放弃了将模态直接打平的融合模式,而是利用语义层级编码器(Semantic-Hierarchy Encoder)将每个模态的特征显式拆解为浅层(Shallow)、中层(Mid)和深层(Deep)三级结构,建立对齐的特征通道基底。
- 预算受控的共享-私有空间解耦: 在每个语义层级内,设计了层内协同交换域(Intra-Level Co-Exchange Domain, IntraCED)。通过正交投影将特征解耦为模态共享(Shared)和模态私有(Private)子空间,并引入基于截断单纯形投影的Token 级预算机制(Token-Level Budget Constraint),将跨模态注意力严格限定在共享子空间内,阻断私有信息的噪声泄漏。
- 锚点引导的层间同步与自适应聚合: 在层间处理阶段,设计了层间协同聚合域(Inter-Level Co-Aggregation Domain, InterCAD)。通过层级锚点(Hierarchical Anchors)动态感知各层级的语义重要性,在共享通道上执行自适应模态选择,同时在私有通道上通过置信度门控(Confidence Gating)直连任务头,避免跨层级的私有特征混淆。
🎯 核心结论:CLCR 证明了“在匹配的语义层级上、仅在解耦的共享子空间内进行受控交互”是解决多模态语义异步与提升特征鲁棒性的关键所在。
机制差异对比
与现有的 SOTA 解耦方法(如 MISA、FDMER)或动态调权方法(如 ARL、EMOE)相比,CLCR 的机制差异如表所示:
- 传统解耦方法:仅在全局单一层级上划分为共享与私有空间,跨深度特征混合时极易造成私有通道信息泄漏到交叉注意力中。
- CLCR 框架:在细粒度的浅、中、深三个维度同步实施空间正交解耦与动态预算过滤,大幅降低了跨模态语义匹配的混乱度。
🔍 背景与动机
在真实世界的多模态数据中,不同模态的信息表征在神经网络的演进过程中展现出极其显著的语义粒度异步性:
- 文本模态:浅层编码词法与语法结构(Subword、POS),中层捕捉短语与句法语义,深层则理解篇章意图与长距离逻辑。
- 视觉模态:浅层包含边缘与局部纹理,中层对应物体部件与短时动作,深层反映整体场景与复杂事件上下文。
- 音频模态:浅层呈现帧级频谱与微观韵律,中层涵盖音素与音色动态,深层表达语篇语调与情感起伏。
当传统模型直接将文本的深层 token(如语篇意图)与视觉的浅层 token(如边缘纹理)进行跨模态注意力计算时,就会触发跨层级语义异步(Cross-Level Semantic Asynchrony)。
💡 关键技巧:想象一场跨国会议,如果让高层战略专家(深层语义)去和对方的实习打字员(浅层特征)直接对等谈判,不仅效率极低,还会因为信息不对等引发严重的理解偏差。正确的做法是“层级对等”:高层对高层、中层对中层,且双方只在公共议题(共享子空间)上交流,内部机密(私有子空间)各自保留。
从信息瓶颈(Information Bottleneck)理论来看,设 为融合特征表示, 为任务标签, 为无用噪声因素。无约束的跨层级混合会导致信息瓶颈中的 增幅远超 ,使得 downstream 预测器难以从混淆的特征中恢复关键信息。CLCR 正是为了在数学和架构层面解开这一瓶颈而设计的。
📊 数据集与实验环境
为全面验证 CLCR 的有效性与泛化能力,作者在 6 个主流多模态基准数据集 上进行了系统实验,涵盖情感分析、事件定位、情绪识别与动作识别等多项任务。
数据集详细配置
- CMU-MOSI:单人演讲视频数据集,包含 2,199 个视频剪辑(训练/验证/测试划分分别为 1,284 / 229 / 686),标注范围为 的连续情感分值,评估指标包含 MAE、Pearson 相关系数 Corr、二分类准确率 、七分类准确率 以及 F1 值。
- CMU-MOSEI:大规模情感分析基准,包含 22,856 个视频剪辑(划分:16,326 / 1,871 / 4,659),包含文本、视觉与音频三种模态。
- CREMA-D:视听情感识别数据集,包含 7,442 个语音-面部视频段落(划分:6,698 / 744),分为 6 个情感类别。
- AVE:视听事件定位数据集,包含 4,143 个 10 秒视听剪辑(划分为 28 个事件类别)。
- Kinetics-Sounds (KS):约 19K 个 10 秒视频剪辑,涵盖 34 类包含显著视觉与听觉动作的类别(划分:15K / 1.9K / 1.9K)。
- UCF101:包含 RGB 图像与光流(Optical Flow)模态,共 101 类动作,官方划分(9,537 / 3,783)。
实验环境与训练细节
- 硬件设施:所有实验均在 NVIDIA A100 GPU 上完成。
- 优化器与超参数:采用带动量的 SGD 优化器(
momentum = 0.9),初始学习率learning_rate = 1e-3,权重衰减weight_decay = 1e-4,批次大小batch_size = 64,训练轮数epochs = 100。 - 评价协议:所有基准均严格执行 5-fold 交叉验证,并汇报均值与标准差。
🛠️ 核心机制与研究方法
CLCR 模型的整体处理流程分为三步:语义层级编码 层内协同交换(IntraCED) 层间协同聚合(InterCAD)。下面将详细剖析各个核心模块的内部机制。

[模态输入 X(m)]
│
▼
[语义层级编码器] ───► 生成浅/中/深三级特征 H_l^{(m)} (l ∈ {1, 2, 3})
│
▼
[IntraCED 模块] ───► 正交分解为共享 H_{l,t,sh}^{(m)} 与私有 H_{l,t,pr}^{(m)}
│ └─► 单纯形投影 Token 预算 B_l 过滤
│ └─► 跨模态注意力 Cross-Attention 交换
▼
[InterCAD 模块] ───► 锚点 g_l 提取 ──► 动态权重 ω_l 跨层同步
│ ├─► 共享流:全局上下文引导的模态选择 z_sh
│ └─► 私有流:置信度门控聚合 u_pr
▼
[任务预测头 y_hat] ───► f_θ(z_sh ⊕ u_pr)
语义层级编码器(Semantic-Hierarchy Encoder)
对于输入的单模态序列 (),首先利用主干网络提取不同深度的特征:
- 文本模态 (L):采用预训练 BERT 的早期、中期和后期 Transformer 层作为浅、中、深特征。
- 视觉 (V) 与音频 (A) 模态:采用具有递增感受野的三级时间卷积网络(TCN)构建。
所有层级的输出均经过线性投影统一映射到维度 ,并加上独立的维次位置编码与层归一化(Layer Normalization): ,其中 分别对应浅、中、深三个层级。
层内协同交换域(IntraCED)
在每一个固定的语义层级 上,IntraCED 独立运行正交空间解耦与受控交叉注意力。
1. 共享-私有空间正交分解
利用 Stiefel 参数化学习正交基底 与 ,构造投影矩阵:
这里 是当前层级所有模态通用的共享空间投影矩阵,而 是模态 专属的私有空间投影矩阵。每个 Token 特征 被完美正交分解为:
2. 截断单纯形 Token 预算选择
并非所有共享 Token 都包含同等价值的跨模态证据。IntraCED 计算每个 Token 的共享特征强度 ,并通过 Sigmoid 生成初步激活权重 。为了控制信息流的容量,将权重向量投影至受限单纯形(Truncated Simplex):
其中 为当前层级可学习的 Token 预算(Token Budget)。通过该投影,只有最具代表性的稀疏 Token 被允许参与后续的跨模态交互。
3. 共享空间注意力交换
目标模态 从其他模态 拼合而成的共享 Token 池中提取补全信息:
这里 均由共享空间特征投影得到。更新后的共享 Token 序列记为 ,私有 Token 序列记为 。
4. 层内可识别性正则化 Loss
为了保证共享与私有空间在统计学上的独立性,引入基于白化交叉相关(Whitened Cross-Correlation)算子 的层内损失 :
式中第一项拉开不同模态私有空间之间的距离,第二项强行消除同模态内共享与私有特征的交叉相关性,控制参数设为 。
层间协同聚合域(InterCAD)
在完成层内交换后,InterCAD 负责对三级语义进行跨深度的同步与任务级聚合。
1. 层级语义锚点同步
首先将各层级的共享与私有序列进行均值池化(Mean Pooling)与层归一化,得到摘要向量 和 。计算跨模态平均锚点 ,并通过双层 MLP 算得层级重要性权重:
利用该权重,将三个层级的摘要归一化同步为统一向量:,。
2. 模态选择与私有门控融合
取全局共享上下文 作为 Query,计算各模态的注意力权重 ,融合得到全局共享描述符 。 同时,对私有流引入置信度门控 ,加权汇总私有描述符 。 最终,拼接共享与私有描述符输入分类/回归头:。
3. 总体优化目标
整体网络采用端到端联合训练,损失函数定义为:
其中 为任务交叉熵或 MSE 损失, 包含了私有冗余约束 、共享-私有跨层泄漏约束 及不兼容层级混合惩罚 ,平衡系数通过验证集调节。
📈 结果与深度分析
在多个公认基准上的对比实验表明,CLCR 相比现有 SOTA 方法展现出了全面的性能超越。
主实验对比分析

在 CREMA-D、KS、AVE 及 UCF101 四个视听基准上(如上图所示),CLCR 均刷新了最高记录。相比于强基线 ARL:
- 在 CREMA-D 上,准确率提升了 1.46%(达到
77.92%),F1 提升 1.48%(达到78.33%)。 - 在 KS 数据集上,准确率与 F1 分别提升 1.32% 与 1.31%。
- 在 AVE 数据集上,准确率提升 1.21%(达到
73.82%)。

在多模态情感分析(MSA)任务中(如上图所示),CLCR 同样表现优异:
- 在 CMU-MOSI 上,MAE 降低至
0.678(较最佳基线下降0.032),二分类准确率 达到88.05%(提升 2.65 pp),F1 达到87.99%。 - 在 CMU-MOSEI 上,MAE 降低至
0.511, 达到56.32%(提升 2.14 pp)。
深度消融实验
为厘清各模块对性能的真实贡献,作者在 MOSI、KS 和 MOSEI 上进行了细致的消融测试。

消融实验结论总结如下:
- 语义层级(Hierarchy)的绝对必要性:当移除三级语义架构(w/o Hierarchy)而采用单层混合时,MOSI 的 MAE 从
0.678恶化至0.720, 从49.56%跌落至46.3%。这直接证明了跨层级语义异步是诱发模型性能下降的关键诱因。 - 解耦交换模块(IntraCED & InterCAD)的作用:去掉 IntraCED 或 InterCAD 均会导致各项指标一致性下滑。例如在 KS 上,无 IntraCED 时 F1 从
75.32%降至72.8%,说明共享-私有正交分解与 Token 预算过滤对避免私有通道干扰起到了决定性作用。 - 跨层对齐策略的扰动实验:将层级特征随机乱序(Full Mix)时,MOSI MAE 暴涨至
0.743;仅错配两层(Partial Mix)时,MAE 为0.722。只有完全按浅、中、深对齐的 CLCR 才能取得0.678的最佳成绩。
特征可视化与鲁棒性分析

通过对 MOSI 测试集特征进行 t-SNE 降维可视化(如上图所示):
- 在无语义层级(a)或无 IntraCED(b)的情况下,正负情感特征点高度重叠缠绕,边界模糊。
- 在完整 CLCR(d)下,特征流展现出极高的紧凑性与单调连续分布,正负情感聚类边界清晰,且不同强度等级呈现出平滑过渡。
⚠️ 局限性:尽管 CLCR 显著缓解了跨层级语义异步问题,但其三级层级设定(浅、中、深)目前依赖于人工先验对齐(如 BERT / TCN 层的三分法)。对于多于三级或无明显层级结构的异质模态(如 Tabular 表格数据),层级划分的自适应映射仍有待进一步研究。
未来,将 CLCR 的层级预算机制与超大规模多模态大模型(LMMs)的内部中间层对齐相结合,将是极具前景的研究方向。