Gyakorlati bevezetés a látásalapú modellek promptolásába és vezérlésébe képszegmentáláshoz, objektumfelismeréshez, képgeneráláshoz, in-paintinghez és személyre szabott képgeneráláshoz.
Szolgáltató
DeepLearning.AI
Szint
Kezdő
Időtartam
1 óra 22 perc
Oktató
Abby Morgan, Jacques Verré and Caleb Kaiser
Formátum
Online, Self-paced, Video lessons, Interactive code examples
A kurzusról
A Prompt Engineering for Vision Models egy kezdő szintű rövid kurzus a DeepLearning.AI-tól, a Comet közreműködésével. Kiterjeszti a prompt engineeringet a szövegalapú modelleken túlra, és bemutatja, hogyan vezérelhetők a látásalapú modellek természetes nyelv, pixelkoordináták, határolókeretek, szegmentációs maszkok és generálási paraméterek segítségével. A tanulók olyan technológiákkal dolgoznak, mint a Meta Segment Anything modellje, az OWL-ViT, a Stable Diffusion és a DreamBooth, miközben felfedezik a képszegmentálást, objektumfelismerést, képgenerálást, in-paintinget, finomhangolást és a kísérletkövetést.
✓Megérteni, hogyan különbözik a promptolás a szöveges és látásalapú modellek között
✓Látásalapú modellek promptolása szöveggel, koordinátákkal és határolókeretekkel
✓Képgenerálási paraméterek, például guidance scale, erősség és következtetési lépések beállítása
✓Képszegmentációs modellek használata egy kép részeinek izolálására
✓Természetes nyelvű promptok használata zero-shot objektumfelismeréshez
✓Szegmentálás, objektumfelismerés és képgenerálás kombinálása in-paintinghez
✓Megérteni, hogyan szabhatja személyre a DreamBooth a diffúziós modellek kimeneteit
✓Kísérletkövetés használata a vizuális promptolás és hiperparaméter-konfigurációk összehasonlítására
Tananyag
1. Bevezetés
Bemutatja a vizuális prompt engineeringet és a kurzus céljait.
2. Áttekintés
Elmagyarázza a kurzus során használt látásalapú modelleket, promptolási módszereket és munkafolyamatokat.
3. Képszegmentálás
Felfedezi a képszegmentációs modellek promptolását pozitív és negatív koordinátákkal, valamint határolókeretekkel.
4. Objektumfelismerés
Természetes nyelvű promptokat használ objektumfelismerő modellekkel objektumok lokalizálására és izolálására képeken belül.
5. Képgenerálás
Felfedezi a diffúzióalapú képgenerálást és az olyan paramétereket, mint a guidance scale, az erősség és a következtetési lépések.
6. Finomhangolás
Bemutatja a diffúziós modellek személyre szabását a DreamBooth segítségével, és bemutatja, hogyan biztosíthat a finomhangolás nagyobb kontrollt a generált képek felett.
7. Következtetés
Áttekinti a kurzus során lefedett főbb vizuális prompt engineering technikákat és munkafolyamatokat.