Saltar al contenido principal

cursos de IA

Ingeniería de prompts para modelos de visión

Una introducción práctica al prompting y control de modelos de visión para segmentación de imágenes, detección de objetos, generación de imágenes, in-painting y generación personalizada de imágenes.

Proveedor
DeepLearning.AI
Nivel
Principiante
Duración
1 hora, 22 minutos
Instructor
Abby Morgan, Jacques Verré and Caleb Kaiser
Formato
Online, Self-paced, Video lessons, Interactive code examples

Acerca del curso

Prompt Engineering for Vision Models es un curso corto para principiantes de DeepLearning.AI en colaboración con Comet. Extiende la ingeniería de prompts más allá de los modelos basados en texto y demuestra cómo los modelos de visión pueden controlarse mediante lenguaje natural, coordenadas de píxeles, cuadros delimitadores, máscaras de segmentación y parámetros de generación. Los estudiantes trabajan con tecnologías como Segment Anything Model de Meta, OWL-ViT, Stable Diffusion y DreamBooth, mientras exploran la segmentación de imágenes, detección de objetos, generación de imágenes, in-painting, ajuste fino y seguimiento de experimentos.

Ver curso en el sitio web del proveedor

Abre un sitio web externo en una nueva pestaña.

Resultados de aprendizaje

  • ✓Comprender cómo difiere el prompting entre modelos de texto y de visión
  • ✓Realizar prompts en modelos de visión usando texto, coordenadas y cuadros delimitadores
  • ✓Ajustar parámetros de generación de imágenes como la escala de guía, la fuerza y los pasos de inferencia
  • ✓Usar modelos de segmentación de imágenes para aislar partes de una imagen
  • ✓Usar prompts de lenguaje natural para la detección de objetos zero-shot
  • ✓Combinar segmentación, detección de objetos y generación de imágenes para in-painting
  • ✓Comprender cómo DreamBooth puede personalizar las salidas de los modelos de difusión
  • ✓Usar el seguimiento de experimentos para comparar el prompting visual y las configuraciones de hiperparámetros

Plan de estudios

1. Introducción

Presenta la ingeniería de prompts visuales y los objetivos del curso.

2. Visión general

Explica los modelos de visión, los métodos de prompting y los flujos de trabajo utilizados a lo largo del curso.

3. Segmentación de imágenes

Explora el prompting de modelos de segmentación de imágenes con coordenadas positivas y negativas y cuadros delimitadores.

4. Detección de objetos

Utiliza prompts de lenguaje natural con modelos de detección de objetos para localizar y aislar objetos dentro de las imágenes.

5. Generación de imágenes

Explora la generación de imágenes basada en difusión y parámetros como la escala de guía, la fuerza y los pasos de inferencia.

6. Ajuste fino

Introduce la personalización de modelos de difusión usando DreamBooth y demuestra cómo el ajuste fino puede proporcionar un mayor control sobre las imágenes generadas.

7. Conclusión

Revisa las principales técnicas de ingeniería de prompts visuales y los flujos de trabajo cubiertos en el curso.

Habilidades incluidas

🧠 Ingeniería de prompts🧠 Visión artificial🧠 Prompting multimodal🧠 Generación de imágenes🧠 Segmentación de imágenes🧠 Detección de objetos🧠 Modelos de difusión🧠 Ajuste fino🧠 In-painting🧠 Personalización de IA🧠 Seguimiento de experimentos