在人工智能推动情感计算蓬勃发展的当下,如何高效利用大量未标注数据进行多模态情绪分析,成为企业和学术界的重大课题。

与传统监督学习方法相比,半监督方法试图在标注成本和模型泛化之间寻求最优平衡,而多模态情绪分析,尤其涉及语音、文本、视觉等模态的复杂交互,天然适合融入半监督框架。
不过,现有半监督方法大多以图像识别为基础任务,依赖任务特定的数据增强策略和伪标签阈值,导致其在多模态情感任务中的泛化性能大打折扣。
基于此,纳斯达克上市企业微美全息(NASDAQ:WIMI)发布最新技术——基于多模态一致性的半监督多模态情绪分析教师模型(MC-Teacher)。该模型结合伪标签策略、自适应过滤网络以及协同一致性理论,为多模态情绪理解带来了新一轮范式革命,尤其适用于未标注数据丰富而标注稀缺的真实场景环境。
据介绍,微美全息MC-Teacher 的核心理念是:协同一致性假设。该假设指出,在面对未标注样本时,如果不同模态之间的表征高度一致,则该样本更可能被正确分类。反之,则可能是带有噪声或模态间表达不一致的误导性实例。

为此,技术团队设计了一种具备自学习能力的过滤网络(Filtering Network),突破了传统基于固定置信度阈值的伪标签筛选方式。该过滤器网络不仅可以自适应判断伪标签的可靠性,而且能够持续从教师网络中学习伪标签分布模式,进而动态优化伪标签采纳策略。
此外,为进一步解决教师-学生网络之间潜在信息泄露和相互依赖的问题,微美全息 MC-Teacher 引入了一种创新的自适应指数移动平均(EMA)机制。实验结果表明,这一策略能有效提高教师网络的稳定性与伪标签的可靠性,增强最终模型的泛化能力。
微美全息在两个具有代表性的多模态情绪分析数据集——CMU-MOSEI 和 CH-SIMS 上展开广泛测试。结果显示,在仅使用30%标注数据的情况下,MC-Teacher 依然能够在多项情绪分析指标上超过完全监督学习模型,提升幅度高达15%以上,表明其极具现实推广潜力。

特别是在模态不完整或存在模态偏置的极端样本下,MC-Teacher 能稳定地输出准确预测结果,这得益于过滤网络对误导性伪标签的高敏感性和良好识别率。
微美全息计划将 MC-Teacher 架构扩展至更多模态组合,如 EEG+语音、图像+文本+手势等多维输入。同时,通过与生成模型(如 Diffusion 模型、GAN)联动,进一步提升伪标签的表达多样性与生成质量。此外,团队还将探索多语言、跨文化场景下的情绪一致性建模,使该技术真正服务于全球多样性情感理解与智能交互。
随着人机交互需求日益增强,情绪智能将成为智能系统不可或缺的核心能力,微美全息MC-Teacher 技术的实践表明,即使在标注资源有限的条件下,也能构建稳健、可信且具有解释性的情绪识别模型,为构建更自然、更具人性化的交互系统奠定坚实基础。

扫一扫,或长按识别二维码
关注艾瑞网官方微信公众号