11.14.3.6.3 Learning Diffusion Models for Description or Text to Image Generation

Chapter Contents (Back)
Learning. Diffusion Models. Synthesis. Image Synthesis. Text to Image.
See also Diffusion for Layout Control in Text to Image Generation.
See also Diffusion for High Resoluion, Super-Resolution Image Generation.
See also Diffusion Process, Diffusion Operators, Mechanism, or Technique.
See also Adversarial Networks for Image Synthesis, Image Generation.
See also Video Diffusion, Video Sysnthesis, Text to Video.
See also Diffusion Process in Image Editing.

Sun, G.[Gan], Liang, W.Q.[Wen-Qi], Dong, J.H.[Jia-Hua], Li, J.[Jun], Ding, Z.M.[Zheng-Ming], Cong, Y.[Yang],
Create Your World: Lifelong Text-to-Image Diffusion,
PAMI(46), No. 9, September 2024, pp. 6454-6470.
IEEE DOI 2408
Task analysis, Dogs, Computational modeling, Semantics, Training, Neural networks, Continual learning, image generation, stable diffusion BibRef

Verma, A.[Ayushi], Badal, T.[Tapas], Bansal, A.[Abhay],
Advancing Image Generation with Denoising Diffusion Probabilistic Model and ConvNeXt-V2: A novel approach for enhanced diversity and quality,
CVIU(247), 2024, pp. 104077.
Elsevier DOI 2408
Deep learning, Diffusion model, Generative model, Image generation BibRef

Ren, J.X.[Jia-Xin], Liu, W.Z.[Wan-Zeng], Chen, J.[Jun], Yin, S.X.[Shun-Xi], Tao, Y.[Yuan],
Word2Scene: Efficient remote sensing image scene generation with only one word via hybrid intelligence and low-rank representation,
PandRS(218), 2024, pp. 231-257.
Elsevier DOI Code:
WWW Link. 2412
Award, U.V. Helava, ISPRS. Intelligentized surveying and mapping, Hybrid intelligence, Remote sensing image scene generation, Diffusion models, Zero-shot learning BibRef

Ridley, H.[Henrietta], Alcover-Couso, R.[Roberto], SanMiguel, J.C.[Juan C.],
Controlling semantics of diffusion-augmented data for unsupervised domain adaptation,
IET-CV(19), No. 1, 2025, pp. e70002.
DOI Link Code:
WWW Link. 2502
image segmentation, unsupervised learning BibRef

Wang, W.L.[Wei-Lun], Bao, J.M.[Jian-Min], Zhou, W.G.[Wen-Gang], Chen, D.D.[Dong-Dong], Chen, D.[Dong], Yuan, L.[Lu], Li, H.Q.[Hou-Qiang],
SinDiffusion: Learning a Diffusion Model from a Single Natural Image,
PAMI(47), No. 5, May 2025, pp. 3412-3423.
IEEE DOI 2504
Diffusion models, Image synthesis, Training, Noise reduction, Periodic structures, Translation, Mathematical models, Art, Noise, image manipulation BibRef

Kim, J.[Jisoo], Kang, J.[Jiwoo], Kim, T.[Taewan], Oh, H.[Heeseok],
SinWaveFusion: Learning a single image diffusion model in wavelet domain,
IVC(159), 2025, pp. 105551.
Elsevier DOI 2505
Single image generation, Denoising diffusion models, Wavelet transform BibRef

Huang, Y.W.[Ya-Wen], Huang, H.M.[Hui-Min], Zheng, H.[Hao], Li, Y.X.[Yue-Xiang], Zheng, F.[Feng], Zhen, X.T.[Xian-Tong], Zheng, Y.F.[Ye-Feng],
Learning to Generalize Heterogeneous Representation for Cross-Modality Image Synthesis via Multiple Domain Interventions,
IJCV(133), No. 7, July 2025, pp. 4727-4748.
Springer DOI 2506
BibRef

Zhang, Z.[Ziyi], Zhang, S.[Sen], Shen, L.[Li], Zhan, Y.B.[Yi-Bing], Luo, Y.[Yong], Hu, H.[Han], Du, B.[Bo], Wen, Y.G.[Yong-Gang], Tao, D.C.[Da-Cheng],
Aligning Text-to-Image Diffusion Models With Constrained Reinforcement Learning,
PAMI(47), No. 11, November 2025, pp. 9550-9562.
IEEE DOI 2510
Optimization, Diffusion models, Noise reduction, Text to image, Neurons, Reinforcement learning, constrained optimization BibRef

Zhang, Z.[Ziyi], Shen, L.[Li], Zhang, S.[Sen], Ye, D.[Deheng], Luo, Y.[Yong], Shi, M.J.[Miao-Jing], Shan, D.J.[Dong-Jing], Du, B.[Bo], Tao, D.C.[Da-Cheng],
Aligning Few-Step Diffusion Models With Dense Reward Difference Learning,
PAMI(48), No. 7, July 2026, pp. 7375-7386.
IEEE DOI 2606
Trajectory, Noise reduction, Diffusion models, Optimization, Standards, Noise, Training, Noise measurement, Text to image, dense rewards BibRef

Zhu, J.Y.[Jing-Yuan], Ma, H.M.[Hui-Min], Chen, J.S.[Jian-Sheng], Yuan, J.[Jian],
DomainStudio: Fine-Tuning Diffusion Models for Domain-Driven Image Generation Using Limited Data,
IJCV(133), No. 10, October 2025, pp. 7012-7036.
Springer DOI 2511
BibRef

Xiang, X.[Xin], Zhou, W.H.[Wen-Hui], Zhu, H.N.[Hao-Nan], Li, Y.[Yunrui], Dai, G.J.[Guo-Jun], Lin, L.[Lili],
EEG-driven natural image reconstruction with regional semantic awareness,
PR(172), 2026, pp. 112589.
Elsevier DOI Code:
WWW Link. 2601
Reconstruct visual stimuli from electroencephalography (EEG) signals. EEG, Visual stimuli, Latent diffusion model, Image reconstruction, Regional semantic awareness, Joint learning BibRef

Mao, Z.D.[Zhen-Dong], Huang, M.Q.[Meng-Qi], Ding, F.[Fei], Liu, M.C.[Ming-Cong], He, Q.[Qian], Zhang, Y.D.[Yong-Dong],
RealCustom++: Representing Images as Real Textual Word for Real-Time Customization,
PAMI(48), No. 2, February 2026, pp. 2078-2095.
IEEE DOI 2601
BibRef
Earlier: A2, A1, A4, A5, A6, Only:
RealCustom: Narrowing Real Text Word for Real-Time Open-Domain Text-to-Image Customization,
CVPR24(7476-7485)
IEEE DOI 2410
Controllability, Training, Semantics, Overfitting, Visualization, Toy manufacturing industry, Text to image, Navigation, curriculum learning. Adaptive systems, Limiting, text-to-image generation, diffusion models BibRef

Ni, Z.[Zanlin], Wang, Y.L.[Yu-Lin], Hua, Y.[Yeguo], Zhou, R.P.[Ren-Ping], Guo, J.Y.[Jia-Yi], Song, J.[Jun], Zheng, B.[Bo], Huang, G.[Gao],
AdaGen: Learning Adaptive Policy for Image Synthesis,
PAMI(48), No. 3, March 2026, pp. 2695-2713.
IEEE DOI 2602
Adaptation models, Predictive models, Image synthesis, Diffusion models, Iterative methods, Generators, iterative generation models BibRef

Guo, J.[Junyi], Chen, H.J.[Hong-Jun], Wang, Q.F.[Qiu-Feng], Chen, Y.[Yaran], Cheng, G.L.[Guang-Liang], Wu, F.Y.[Fang-Yu], Lim, E.G.[Eng Gee],
EmoSENSE: Modeling Sentiment-Semantic Knowledge With Hierarchical Reinforcement Learning for Emotional Image Generation,
AffCom(17), No. 2, April 2026, pp. 1806-1822.
IEEE DOI 2606
Image synthesis, Semantics, Visualization, Correlation, Reinforcement learning, Adaptation models, Affective computing BibRef

Fuest, M.[Michael], Ma, P.[Pingchuan], Gui, M.[Ming], Schusterbauer, J.[Johannes], Hu, V.T.[Vincent Tao], Ommer, B.[Björn],
Diffusion Models and Representation Learning: A Survey,
PAMI(48), No. 7, July 2026, pp. 7209-7228.
IEEE DOI 2606
Diffusion models, Representation learning, Noise, Noise reduction, Surveys, Noise measurement, Training, Neural networks, Taxonomy, representation learning BibRef

Wang, Y.B.[Ya-Bin], Hong, X.P.[Xiao-Peng], Ma, Z.H.[Zhi-Heng], Su, Z.[Zhou], Zhang, J.P.[Jin-Peng], Huang, Z.W.[Zhi-Wu],
Continual Conceptual Entity Learning for Text-to-Image Generative Models,
MultMed(28), 2026, pp. 5785-5797.
IEEE DOI 2607
Text to image, Training, Diffusion models, Adaptation models, Generators, Data models, Noise reduction, Interference BibRef

Dubey, A.[Adarsh], Sharma, M.[Mridul], Kancharla, P.[Parimala],
Selective subspace unlearning for text to image diffusion models,
PRL(207), 2026, pp. 260-265.
Elsevier DOI 2608
Machine unlearning, Nash bargaining, Text-to-image, Concept erasing BibRef

Zhu, Y.F.[Yi-Fan], Wang, C.J.[Cheng-Jia], Dong, X.H.[Xing-Hui],
UMDM-USG: A unified multi-view diffusion model for underwater scene generation via cross-view representation alignment,
PR(180), 2026, pp. 114232.
Elsevier DOI 2608
Multi-view learning, Cross-view representation alignment, Underwater scene generation, Diffusion model, Dense prediction BibRef


Song, J.[Jaewoo], Choi, J.Y.[Joo-Young], Baek, K.[Kanghyun], Lee, S.[Sangyub], Park, D.[Daemin], Yoon, S.[Sungroh],
DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer Strategy,
WACV26(4305-4314)
IEEE DOI 2609
Protocols, Product development, Graphical user interfaces, Artificial intelligence, Diffusion models, Machine learning, Text to image BibRef

Dong, S.[Sibo], Shaheen, I.[Ismail], Shen, M.[Maggie], Mallick, R.[Rupayan], Bargal, S.A.[Sarah Adel],
ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models,
WACV26(12-21)
IEEE DOI 2609
Protocols, Amplitude shift keying, LoRa, Videos, story generation, multimodal learning BibRef

Hu, Z.J.[Zi-Jing], Zhang, F.D.[Feng-Da], Chen, L.[Long], Kuang, K.[Kun], Li, J.H.[Jia-Hui], Gao, K.[Kaifeng], Xiao, J.[Jun], Wang, X.[Xin], Zhu, W.W.[Wen-Wu],
Towards Better Alignment: Training Diffusion Models with Reinforcement Learning Against Sparse Rewards,
CVPR25(23604-23614)
IEEE DOI 2508
Training, Codes, Noise reduction, Text to image, Reinforcement learning, Diffusion models, Optimization BibRef

Ye, Z.[Zilyu], Chen, Z.Y.[Zhi-Yang], Li, T.C.[Tian-Cheng], Huang, Z.[Zemin], Luo, W.J.[Wei-Jian], Qi, G.J.[Guo-Jun],
Schedule On the Fly: Diffusion Time Prediction for Faster and Better Image Generation,
CVPR25(23412-23422)
IEEE DOI 2508
Image quality, Schedules, Image synthesis, Noise reduction, Noise, Text to image, Reinforcement learning, Diffusion models, Noise level BibRef

Thakral, K.[Kartik], Glaser, T.[Tamar], Hassner, T.[Tal], Vatsa, M.[Mayank], Singh, R.[Richa],
Fine-Grained Erasure in Text-To-Image Diffusion-Based Foundation Models,
CVPR25(9121-9130)
IEEE DOI 2508
Manifolds, Foundation models, Computational modeling, Semantics, Text to image, Dogs, Flowering plants, Diffusion models, unlearning, diffusion BibRef

Jun, Y.[Youngjun], Park, J.[Jiwoo], Choo, K.[Kyobin], Choi, T.E.[Tae Eun], Hwang, S.J.[Seong Jae],
Disentangling Disentangled Representations: Towards Improved Latent Units via Diffusion Models,
WACV25(3559-3569)
IEEE DOI 2505
Training, Disentangled representation learning, Semantics, Noise reduction, Stochastic processes, Focusing, Transforms, diffusion models BibRef

Zhang, J.Y.[Jian-Yi], Zhou, Y.F.[Yu-Fan], Gu, J.X.[Jiu-Xiang], Wigington, C.[Curtis], Yu, T.[Tong], Chen, Y.R.[Yi-Ran], Sun, T.[Tong], Zhang, R.[Ruiyi],
ARTIST: Improving the Generation of Text-Rich Images with Disentangled Diffusion Models and Large Language Models,
WACV25(1268-1278)
IEEE DOI 2505
Training, Visualization, Accuracy, Image synthesis, Large language models, Disentangled representation learning, Rendering (computer graphics) BibRef

Butt, M.A.[Muhammad Atif], Wang, K.[Kai], Vazquez-Corral, J.[Javier], van de Weijer, J.[Joost],
ColorPeel: Color Prompt Learning with Diffusion Models via Color and Shape Disentanglement,
ECCV24(VII: 456-472).
Springer DOI 2412
Project:
WWW Link. BibRef

Zhang, D.J.H.[David Jun-Hao], Xu, M.[Mutian], Wu, J.Z.J.[Jay Zhang-Jie], Xue, C.[Chuhui], Zhang, W.Q.[Wen-Qing], Han, X.G.[Xiao-Guang], Bai, S.[Song], Shou, M.Z.[Mike Zheng],
Free-atm: Harnessing Free Attention Masks for Representation Learning on Diffusion-generated Images,
ECCV24(XL: 465-482).
Springer DOI 2412
BibRef

Hudson, D.A.[Drew A.], Zoran, D.[Daniel], Malinowski, M.[Mateusz], Lampinen, A.K.[Andrew K.], Jaegle, A.[Andrew], McClelland, J.L.[James L.], Matthey, L.[Loic], Hill, F.[Felix], Lerchner, A.[Alexander],
SODA: Bottleneck Diffusion Models for Representation Learning,
CVPR24(23115-23127)
IEEE DOI 2410
Representation learning, Training, Visualization, Image synthesis, Semantics, Noise reduction, Self-supervised learning, classification BibRef

Miao, Z.C.[Zi-Chen], Wang, J.[Jiang], Wang, Z.[Ze], Yang, Z.Y.[Zheng-Yuan], Wang, L.J.[Li-Juan], Qiu, Q.[Qiang], Liu, Z.C.[Zi-Cheng],
Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning,
CVPR24(10844-10853)
IEEE DOI 2410
Training, Gradient methods, Limiting, Image synthesis, Estimation, Diffusion processes, Reinforcement learning BibRef

Zhu, R.[Rui], Pan, Y.W.[Ying-Wei], Li, Y.[Yehao], Yao, T.[Ting], Sun, Z.L.[Zheng-Long], Mei, T.[Tao], Chen, C.W.[Chang Wen],
SD-DiT: Unleashing the Power of Self-Supervised Discrimination in Diffusion Transformer*,
CVPR24(8435-8445)
IEEE DOI 2410
Training, Image synthesis, Noise, Diffusion processes, Ordinary differential equations, Transformers, self-supervised learning BibRef

Deng, F.[Fei], Wang, Q.F.[Qi-Fei], Wei, W.[Wei], Hou, T.B.[Ting-Bo], Grundmann, M.[Matthias],
PRDP: Proximal Reward Difference Prediction for Large-Scale Reward Finetuning of Diffusion Models,
CVPR24(7423-7433)
IEEE DOI 2410
Training, Technological innovation, Closed box, Reinforcement learning, Diffusion models, RLHF BibRef

Yu, Y.Y.[Yu-Yang], Liu, B.Z.[Bang-Zhen], Zheng, C.X.[Chen-Xi], Xu, X.M.[Xue-Miao], He, S.F.[Sheng-Feng], Zhang, H.D.[Huai-Dong],
Beyond Textual Constraints: Learning Novel Diffusion Conditions with Fewer Examples,
CVPR24(7109-7118)
IEEE DOI Code:
WWW Link. 2410
Training, Adaptation models, Codes, Text to image, Diffusion processes, Diffusion models, diffusion model BibRef

Dalva, Y.[Yusuf], Yanardag, P.[Pinar],
NoiseCLR: A Contrastive Learning Approach for Unsupervised Discovery of Interpretable Directions in Diffusion Models,
CVPR24(24209-24218)
IEEE DOI 2410
Image synthesis, Computational modeling, Semantics, Text to image, Contrastive learning, Diffusion models, semantic discovery BibRef

Luo, G.[Grace], Darrell, T.J.[Trevor J.], Wang, O.[Oliver], Goldman, D.B.[Dan B], Holynski, A.[Aleksander],
Readout Guidance: Learning Control from Diffusion Features,
CVPR24(8217-8227)
IEEE DOI Code:
WWW Link. 2410
Training, Head, Image edge detection, Training data, Text to image, Diffusion models, Image and video synthesis and generation BibRef

Wallace, B.[Bram], Dang, M.[Meihua], Rafailov, R.[Rafael], Zhou, L.Q.[Lin-Qi], Lou, A.[Aaron], Purushwalkam, S.[Senthil], Ermon, S.[Stefano], Xiong, C.M.[Cai-Ming], Joty, S.[Shafiq], Naik, N.[Nikhil],
Diffusion Model Alignment Using Direct Preference Optimization,
CVPR24(8228-8238)
IEEE DOI 2410
Training, Learning systems, Visualization, Pipelines, Text to image, Reinforcement learning, Diffusion models, generative, diffusion, dpo BibRef

Gokaslan, A.[Aaron], Cooper, A.F.[A. Feder], Collins, J.[Jasmine], Seguin, L.[Landan], Jacobson, A.[Austin], Patel, M.[Mihir], Frankle, J.[Jonathan], Stephenson, C.[Cory], Kuleshov, V.[Volodymyr],
Common Canvas: Open Diffusion Models Trained on Creative-Commons Images,
CVPR24(8250-8260)
IEEE DOI 2410
Training, Computational modeling, Transfer learning, Text to image, Diffusion models, Data models, diffusion, copyright, text2image, dataset BibRef

Mo, W.[Wenyi], Zhang, T.Y.[Tian-Yu], Bai, Y.[Yalong], Su, B.[Bing], Wen, J.R.[Ji-Rong], Yang, Q.[Qing],
Dynamic Prompt Optimizing for Text-to-Image Generation,
CVPR24(26617-26626)
IEEE DOI 2410
Uniform resource locators, Training, Image synthesis, Semantics, Refining, Text to image, Reinforcement learning, Diffusion Model BibRef

Zhang, G.[Gong], Wang, K.[Kai], Xu, X.Q.[Xing-Qian], Wang, Z.Y.[Zhang-Yang], Shi, H.[Humphrey],
Forget-Me-Not: Learning to Forget in Text-to-Image Diffusion Models,
WhatNext24(1755-1764)
IEEE DOI 2410
Adaptation models, Privacy, Accuracy, Computational modeling, Knowledge based systems, Text to image, Safety, text-to-image, concept forgetting BibRef

Qi, T.H.[Tian-Hao], Fang, S.C.[Shan-Cheng], Wu, Y.Z.[Yan-Ze], Xie, H.T.[Hong-Tao], Liu, J.W.[Jia-Wei], Chen, L.[Lang], He, Q.[Qian], Zhang, Y.D.[Yong-Dong],
DEADiff: An Efficient Stylization Diffusion Model with Disentangled Representations,
CVPR24(8693-8702)
IEEE DOI Code:
WWW Link. 2410
Learning systems, Visualization, Semantics, Text to image, Feature extraction, Diffusion models BibRef

Patel, M.[Maitreya], Kim, C.[Changhoon], Cheng, S.[Sheng], Baral, C.[Chitta], Yang, Y.Z.[Ye-Zhou],
ECLIPSE: A Resource-Efficient Text-to-Image Prior for Image Generations,
CVPR24(9069-9078)
IEEE DOI Code:
WWW Link. 2410
Training, Image coding, Image synthesis, Computational modeling, Text to image, Contrastive learning, Diffusion models, ECLIPSE BibRef

Ramasinghe, S.[Sameera], Shevchenko, V.[Violetta], Avraham, G.[Gil], Thalaiyasingam, A.[Ajanthan],
Accept the Modality Gap: An Exploration in the Hyperbolic Space,
CVPR24(27253-27262)
IEEE DOI 2410
Text to image, Machine learning, Linear programming, multimodal learning, modality gap BibRef

Li, C.[Cheng], Qi, Y.[Yali], Zeng, Q.T.[Qing-Tao], Lu, L.[Likun],
Comparison of Image Generation methods based on Diffusion Models,
CVIDL23(1-4)
IEEE DOI 2403
Training, Deep learning, Learning systems, Image synthesis, Computational modeling, Diffusion models BibRef

Sehwag, V.[Vikash], Hazirbas, C.[Caner], Gordo, A.[Albert], Ozgenel, F.[Firat], Ferrer, C.C.[Cristian Canton],
Generating High Fidelity Data from Low-density Regions using Diffusion Models,
CVPR22(11482-11491)
IEEE DOI 2210
Manifolds, Computational modeling, Diffusion processes, Data models, Representation learning BibRef

Chapter on 3-D Object Description and Computation Techniques, Surfaces, Deformable, View Generation, Video Conferencing continues in
Diffusion for Layout Control in Text to Image Generation .


Last update:Sep 21, 2026 at 18:29:27