国内刊号:11-5602/TP
国际刊号:1673-9418
发布日期:
作者:岳颀, 张晨康
单位:西安邮电大学 自动化学院,西安 710121
关键词:生成式人工智能(AIGC),多模态,大语言模型
虽然生成式人工智能(AIGC)已经能够在单一模态应用领域取得优异成果,可以利用人工智能技术生成文字、图像、视频等内容,但单一模态的特征表示很难完整包含某个现象的完整信息。为了提高模型的学习性能和生成能力,学者们提出将多模态信息应用在AIGC中。AIGC能够对输入的多模态信息进行融合,获取更丰富的上下文信息,帮助模型更好地理解和生成内容。深入探讨了AIGC处理多模态问题的基本架构、工作原理和挑战,并对近年来与多模态信息结合的AIGC模型进行了分类和归纳。总结了AIGC在多模态图像生成、视频生成、三维形状生成等方面的应用、挑战和发展方向。在图像生成方面,讨论了生成对抗网络(GAN)模型、扩散模型等技术的应用和局限性。在视频生成方面,分析了基于扩散模型的视频生成技术,并探讨了音视频联合生成的方法。在三维形状生成方面,探讨了扩散模型和神经网络指导下的三维形状生成方法。最后提出了AIGC面临的挑战与未来潜在的研究方法。
来源:2025年第1期
《计算机科学与探索》期刊编辑部