国内刊号:11-5602/TP
国际刊号:1673-9418
发布日期:
作者:黄万鑫, 任英杰, 芦天亮, 杨刚, 袁梦娇, 曾高俊
单位:1. 中国人民公安大学 信息网络安全学院,北京 1000382. 中国人民公安大学 公安行业大模型研究与应用实验室,北京 1000383. 公安部 网络安全保卫局,北京 100741
关键词:人脸生成,多模态,扩散模型,智能生成,注意力机制
基金:中国人民公安大学网络空间安全执法技术双一流创新研究专项(2023SYL07);中央高校基本科研业务费项目(2022JKF02022)。
人脸生成是计算机视觉的前沿课题,在刑事侦查、虚拟现实等领域有广泛的应用前景。近年来扩散模型展现出卓越的生成能力,能够根据限定条件生成高语义一致性的图片,应用于生成人脸方向上成为新趋势。然而,现有生成方法中基于常规扩散的方法对条件信息细节理解不足,未能充分利用条件信息精准生成人脸;基于扩散大模型的方法通常需耗费大量计算资源微调模型,抑或添加额外复杂网络且未能均衡融合多模态条件信息。针对上述挑战,提出面向扩散大模型的多模态生成人脸方法MA-adapter,添加小型精简网络提取视觉结构信息融合语义指导扩散大模型精准生成人脸,充分利用扩散大模型生成能力的同时避免耗费大量计算资源进行微调。该模型利用多头注意力模块(MAM)增强图片模态提示,使模型更加关注关键信息;通过多尺度特征模块(MFM)提取多尺度特征信息,为精准指导生成提供保障;设计自适应调节机制(AAM),自适应调节不同特征层的生成指导系数以实现更佳性能。实验结果表明,在MM-CelebA-HQ数据集上与当前主流方法T2I-adapter相比,MA-adapter的感知相似指标LPIPS下降约18.4%,图文匹配指标CLIP-Score提高约13.6%,特征相似指标CLIP-I增长约14.8%。大量实验结果充分验证MA-adapter的有效性及优越性。
来源:2025年第10期
《计算机科学与探索》期刊编辑部