移动互联网

微美全息(NASDAQ:WIMI)深度模块化协同注意力转移网络,让多模态情绪分析“质变”升级!

2025/9/1 14:32:00

在数字化和社交网络深度融合的时代,人类情绪的表达早已超越了单一的语言形式,文本、语音、面部表情、肢体动作等多种非语言模态共同构成了复杂且多变的情感信号。


这种多模态信息融合所涉及的计算机理解任务——多模态情绪分析(MSA)——成为人工智能领域极具挑战性与吸引力的研究热点。

添加图片注释,不超过 140 字(可选)

据悉,微美全息(NASDAQ:WIMI)自主研发的一项全新技术——深度模块化协同注意力转移网络(CoASN),在CMU-MOSI与CMU-MOSEI等权威数据集上取得了超越当前先进模型的成果,标志着多模态情绪分析研究的一个新高度。


多模态情绪分析并非简单的信息融合任务,其核心挑战在于如何在语言主导的信息中,充分挖掘非语言模态的语义潜力,并将各模态间的关联动态整合起来。


为了解决难题,微美全息提出了CoASN架构,这是一种融合共同注意转移和深度模块化建模的创新性神经网络结构,通过构建跨模态调制机制和自适应门控机制,实现对多模态情感信息的协同理解与表征转移。


微美全息CoASN的技术核心是由两个主要模块组成:跨模态调制模块(CMMC)与模态混合自适应门(AMAG)。在CMMC模块中,我们提出了一个以文本为中心的文本引导的共同注意机制(TCA),结合内部Transformer编码器单元(ITE),对模态间与模态内的信息进行统一编码。

添加图片注释,不超过 140 字(可选)

TCA通过对语言模态进行全局编码,然后作为上下文引导视觉和音频模态的情感特征学习,确保语言模态在建模中发挥主导作用,而非语言模态则围绕文本语义进行对齐、补充与增强。这种引导式建模策略不仅提升了非语言模态的判别能力,也提高了整体语义表达的情感准确性。


另外,多模态情绪分析的发展对人工智能的理解能力提出了前所未有的挑战,让文本不再是唯一的表达形式,视频、音频、动作乃至生理信号共同构成了人类多维度的情绪空间。在这一趋势下,CoASN正是站在多模态交互的交汇点上,用协同注意力机制重新定义了模态之间的语义沟通方式。


总之,微美全息深度模块化协同注意力转移网络,不仅仅是一种模型创新,更是一种认知建模的范式转变。可以相信,随着该技术的持续优化与开放协同,其将有望构建更加真实、敏感、全面的AI情绪理解系统,推动“懂你所想,知你所感”的人机共情时代加速到来。


版权声明
本文仅代表作者观点,不代表艾瑞立场。本文系作者授权艾瑞专栏发表,未经许可,不得转载。

专家介绍

爱好了解科技新闻
  • 合作伙伴

  • 官方微信
    官方微信

    新浪微博
    邮件订阅
    第一时间获取最新行业数据、研究成果、产业报告、活动峰会等信息。
     关于艾瑞| 业务体系| 加入艾瑞| 服务声明| 信息反馈| 联系我们| 合作伙伴| 友情链接

Copyright© 沪公网安备 31010402000581号沪ICP备15021772号-10

扫一扫,或长按识别二维码

关注艾瑞网官方微信公众号