Diffusion Models: From Prompts to Images and Video
AMD AI Academy · 27 de junio de 2026
AMD AI Academy — AI Developer Program
- Modelos de difusión
- Generación de imágenes (text-to-image)
- Generación de video (text-to-video)
- Tokenizer, CLIP, VAE, U-Net
- Schedulers
- Diffusers / ComfyUI sobre GPU
Lo que cubre
Curso de AMD AI Academy sobre modelos de difusión — la tecnología detrás de la generación de imágenes y video: cómo un prompt de texto se transforma paso a paso en una imagen o un video, con los componentes internos del pipeline corriendo sobre GPUs AMD.
Lo que aprendí
- Componentes del pipeline: tokenizer, CLIP (condicionamiento de texto), VAE (espacio latente), U-Net (denoising) y schedulers (muestreo).
- Text-to-image y text-to-video: cómo fluye el ruido controlado por el prompt hasta convertirse en píxeles.
- Práctica sobre GPU: ejecución de pipelines de difusión con herramientas como Diffusers sobre hardware acelerado.
- Trade-offs: velocidad vs. calidad de generación según scheduler y resolución.
Por qué importa
Los modelos de difusión son el motor de la IA generativa visual. Entender el pipeline por dentro — y no solo promptearlo — marca la diferencia entre usar estas herramientas y dominarlas. Completado al 100% dentro del AI Developer Program (Advanced Builder, 1,225 puntos, 5 cursos, 4 insignias).
Institución
AMD AI Academy — programa oficial de formación en IA de AMD (developer.amd.com/academy).