SeRIn
1、模块名称 SeRIn研究思路普通跨模态注意力让音频、视觉和文本很早就开始互相影响。这样虽然能快速完成融合但也容易产生一个问题还没有充分提炼好的单模态信息已经被其他模态污染或覆盖。这在文本主导的数据集上尤其明显。文本信息较强时音频和视觉一旦过早与文本混合很容易失去自己的独立表达最后模型虽然名义上使用了三种模态实际仍然主要依赖文本。SeRIn 的核心判断是单模态提炼和跨模态融合不应该同时发生而应该在结构上分阶段完成。因此论文提出了三个连续过程Segregate、Refine、Integrate即隔离、提炼、整合。2、研究方法先让音频和视觉在各自独立的通道中成长再让一个专门的 AV 通道旁观并汇总二者最后只在预测阶段允许所有信息自由交互。右图把中间的 MMLM 放大成两个部分左边蓝框LM Block右边红框MM Block。LM Block 主要负责语言上下文建模MM Block 则负责把音频和视觉信息注入 Fusion Token。LLMBlock文本 Token 按照 GPT-2 原有的因果注意力方式进行处理即每个文本 Token 只能读取自己和前面的文本。但是附加在后面的 Fusion Token 可以读取完整的文本序列。这样Audio、Visual 和 AV Fusion Token 都会获得当前话语的语言语境。GPT-2它是一个固定的语言语境加工器文本 Token按照因果顺序理解前文Fusion Tokens 则读取完整文本从而获得语言背景真正的音频和视觉注入主要由后面的可训练 MM Block 完成。MMBlock1)MM Block 底部有三个并行的 IGCAAudio Fusion Token 通过 IGCA 读取 ZaVisual Fusion Token 通过 IGCA 读取 ZvAV Fusion Token 通过 IGCA 读取 Zav2)IGCA 是 Internally Gated Cross-Attention内部门控跨注意力。例如Audio Fusion Token 作为 Query音频编码器输出 Za 作为 Key 和 Value。这样Audio Token 会主动从音频序列中寻找与当前语言语境相关的信息。3)MM Block 的 IGCA 和 IGSA 只对三组 Fusion Tokens 进行跨模态注入与通道整理文本 Token 不参加这些注意力操作。MM Block 最后的可训练 FFN会处理包括文本在内的完整序列但由于 FFN 是逐 Token 操作文本仍不会直接接收 A/V 信息。论文表述对应模块实际发生的操作音频和视觉先分别提炼Audio/Visual Encoder分别生成Za,Zv建立独立通道Audio/Visual Fusion TokensXfa,Xfv分组保持通道独立LM Block 的 (M^{mc}_{LM})A、V Tokens 不能互相读取注入各自模态信息MM Block 的 IGCAXav---Zv在通道内部整理MM Block 的 IGSAA、V 分别进行组内自注意力AV 通道旁观并汇总AV Fusion Tokens(X_{fav}) 读取 A、V TokensAV 获取底层联合信息AV IGCAXav -Zav不反向干扰 A/VLM/MM MaskA、V 不能读取 AV Tokens最后完全融合Integration Head七种表示进行无约束自注意力输出情感结果Prediction Head根据[CLS]预测情感分数数据集表现消融实验这篇论文的消融做得比较有价值因为作者不是简单地逐个删除模块而是重点验证“交互结构是否真的重要”。1最关键的结果是删除 LM 层中的模态约束 Mask 后SIMS 的 Acc-2 从 84.30 降到 82.08MOSEI 从 87.79 降到 85.98。而且这个版本仍然保留了大部分新增参数却比 DeepMLF 还差。因此作者据此说明性能提升不是因为增加了更多 IGCA 或参数而是因为这些模块被组织在正确的交互拓扑中。2还有一个很有意思的现象当 MM 层的约束 Mask 被删除后IGSA 变成不受限制的自注意力此时再删除 IGSA性能反而有所恢复。这说明 IGSA 本身不是天然有效的。只有在正确 Mask 约束下它才是“单模态内部整理”没有 Mask 时它就会造成过早混合和模态干扰。这也是论文最值得学习的实验观点模块的价值不能脱离它所在的信息流结构来评价。创新点创新一把交互拓扑作为独立设计变量过去通常研究融合深度、注意力形式、Token 数量或损失函数。SeRIn 强调模态之间“谁能读取谁”本身也是一个可以系统设计的变量。这一立意比较完整不只是简单换了一个注意力公式。创新二单模态通道与联合通道结构性分离它不是通过解耦损失让音频和视觉“尽量不同”而是直接从计算图上阻止它们过早相互影响。这种结构约束比辅助损失更直接也更容易解释。创新三AV 只读通道AV Token 能读取音频和视觉但音频和视觉不能读取 AV Token。这种非对称关系使联合通道能够积累跨模态信息又不反向污染单模态表示。这是 SeRIn 最有辨识度的设计。创新四门控位于注意力内部门控不是一个模态级标量而是逐 Token、逐维度控制注意力结果。这使模型能够进行更细粒度的信息筛选。交叉拓扑这里的“拓扑”不是指网络有多少层、多少参数而是指模型中的不同表示谁可以读取谁信息能够往哪个方向流动哪些通道之间禁止直接交互。可以把 Text、Audio、Visual、AV 四组 Token 看成四个节点。SeRIn 为它们规定了固定的连接关系。换成自然语言就是Audio Token 可以读取文本和自己的 Audio TokenVisual Token 可以读取文本和自己的 Visual TokenAV Token 可以读取文本、Audio Token、Visual Token 和自身Audio 与 Visual 不能直接互读AV 可以读取 A/V但不能反向把融合信息写回 A/V文本不能读取任何 Fusion Token。这个“谁连谁、谁不连谁”的结构就是interaction topology交互拓扑。其他论文题目是 《Segregate, Refine, Integrate: Decomposing Multimodal Fusion for Sentiment Analysis》简称 SeRIn。作者主要来自雅典国立技术大学、Athena Research Center、伯尔尼大学等机构论文发表于 Interspeech 2026同时公开在 arXiv并提供了官方代码。