计算机科学与探索

北大核心,INSPEC,JST,CSCD,WJCI

国内刊号:11-5602/TP

国际刊号:1673-9418

计算机科学与探索杂志2025年第11期:少样本运动模式学习与视频生成控制策略

发布日期:

作者:冯思聪, 彭力

单位:江南大学 物联网工程学院 物联网技术应用教育部工程研究中心,江苏 无锡 214122

关键词:视频生成,扩散模型,动态掩码,少样本学习

基金:国家自然科学基金(61873112)。

随着深度学习的迅速发展,扩散模型在图像生成与视频生成领域取得了显著成效,使文本驱动的视频生成逐渐成为研究热点。然而,现有的文本生成视频模型仍面临诸多挑战,例如,高昂的训练成本与庞大的数据需求限制了模型的应用场景,同时在视频内容的交互式编辑能力方面关注不足,难以满足多样化的生成需求。针对以上挑战,提出一种通过少样本学习的动态掩码引导视频生成网络(DyMask-Vid),仅需少量视频数据就可在消费级GPU上完成训练。该模型在现有模型中引入了文本感知掩码交叉注意力层(TAMCA),以增强训练过程中对视频前景区域的注意力,从而实现文本提示与视频内容的精确匹配,同时为了适应首帧生成策略,该模型加入了时空自注意力层(TSSA)。在生成阶段,模型通过动态掩码和文本提示实现对生成内容的精确控制,同时为了提高生成视频的稳定性,设计了一种时序共享噪声策略(TNSS)。通过广泛的定性和定量实验验证,该方法在视频生成和编辑任务中表现出色,在一致性和生成质量方面显著优于现有的一些方法。

来源:2025年第11期

《计算机科学与探索》期刊编辑部

查看计算机科学与探索杂志2025年第11期

联系我们

  • 地址:北京市海淀区北四环中路211号
  • 电话:(010)89056056
  • E-mail:fcst@vip.163.com

咨询工作人员