
音视频智能是人工智能技术在音频与视频处理领域的应用,涉及多模态联合建模,以实现内容的智能生成、分析、修复与交互 。该技术涵盖视听内容生成、虚拟拍摄、智能译制、实时通话、课堂循迹分析及受损声音修复等多种场景 ,并延伸至具身智能、物联网等领域 。
其早期研究聚焦于单点技术突破,如2018年天津大学张涛副教授团队基于神经网络实现了受损语音修复 。2024年,湖南省提出打造全国首个音视频AI大模型 ,万兴科技推出了“天幕”音视频创作大模型 。2025年7月,浦东新区举办的“先进音视频技术发展论坛”围绕“音视频技术与具身智能”展开探讨 。2026年,行业论坛聚焦AI影视创作与多模态数据融合 ,同期提出了《人工智能生成合成视频分类要素与测评方法》等标准 ;同年5月,新加坡国立大学等机构发布了首份系统性的音视频智能大模型综述 。
想要了解更多“音视频智能”的信息,请点击:音视频智能百科
