国内刊号:11-5602/TP
国际刊号:1673-9418
发布日期:
作者:冯思聪, 彭力
单位:江南大学 物联网工程学院 物联网技术应用教育部工程研究中心,江苏 无锡 214122
关键词:视频生成,扩散模型,动态掩码,少样本学习
基金:国家自然科学基金(61873112)。
随着深度学习的迅速发展,扩散模型在图像生成与视频生成领域取得了显著成效,使文本驱动的视频生成逐渐成为研究热点。然而,现有的文本生成视频模型仍面临诸多挑战,例如,高昂的训练成本与庞大的数据需求限制了模型的应用场景,同时在视频内容的交互式编辑能力方面关注不足,难以满足多样化的生成需求。针对以上挑战,提出一种通过少样本学习的动态掩码引导视频生成网络(DyMask-Vid),仅需少量视频数据就可在消费级GPU上完成训练。该模型在现有模型中引入了文本感知掩码交叉注意力层(TAMCA),以增强训练过程中对视频前景区域的注意力,从而实现文本提示与视频内容的精确匹配,同时为了适应首帧生成策略,该模型加入了时空自注意力层(TSSA)。在生成阶段,模型通过动态掩码和文本提示实现对生成内容的精确控制,同时为了提高生成视频的稳定性,设计了一种时序共享噪声策略(TNSS)。通过广泛的定性和定量实验验证,该方法在视频生成和编辑任务中表现出色,在一致性和生成质量方面显著优于现有的一些方法。
来源:2025年第11期
《计算机科学与探索》期刊编辑部