国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:张振兴(), 杨任农, 李永林, 左家亮, 胡利平, 陈双艳
单位:空军工程大学空管领航学院,陕西 西安 710051
关键词:文本到图像生成,生成对抗网络,注意力机制,单阶段架构
基金:国家自然科学基金青年基金(71501184,62106284);陕西省自然科学基金(2021JQ370);西安市科协青年人才托举计划(0959202513098)资助课题;
针对多阶段文本到图像生成方法存在的3个显著问题,即学习多个神经网络会延长收敛时间、忽视早期生成器生成图像的质量、需要训练多个对抗器,提出基于双重注意力生成对抗网络(double-attention generative adversarial network,DoubleGAN)的文本到图像生成模型。DoubleGAN纳入通道与像素注意机制,使用语句向量引领生成器聚焦于与文字内容紧密关联的通道及像素点。同时,提出条件自适应的实例级?层标准化方法,该方法能够依据语言信息调控形状与纹理的变动幅度,从而显著增强视觉?语义的对应关系并促进训练过程的稳定性。同时,采用一种视觉损失来增强图像分辨率,确保生成图像具有生动的形状和感知上均匀的颜色分布。实验结果表明,DoubleGAN实现了优秀的性能,在CUB bird-200-2011(Caltech-UCSD Birds-200-2011)数据集上将初始分数(inception score,IS)从4.75显著提高到4.97,具有实际应用价值。
来源:2026年第1期
《系统工程与电子技术》期刊编辑部