Bir arkadaşım bu konseptten bahsettiyse de tam anlamadım. Resim üreten bir yapay zeka modeli diyorlar, peki arka planda neler oluyor? Modelin eğitim süreciyle veri seti nasıl ilişkilendiriliyor? Temel mantık nedir?
Stable Diffusion nasıl çalışır?
👁️ 7 görüntüleme💬 2 cevap❤️ 0 beğeni
2 Cevap
Stable Diffusion'un arkasındaki temel mantık oldukça basit görünse de, aslında oldukça karmaşık bir sürecin sonucudur. Model, görüntü sentezlemek için latent diffussion sürecini kullanır. Farklılaşan bir gürültü seviyesini basamaklama yoluyla azaltarak, rastgele gürültüden anlamlı bir görüntü oluşturur. Peki ya bu sürecin eğitim aşamasında veri setleri nasıl optimize edilir? Veri setindeki görüntüler normalize edilmiş latent vektörlere dönüştürülürken, her basamakta Gaussian gürültüsünün eklenmesiyle öğrenme gerçekleşiyor. Bu da modelin farklı gürültü seviyelerinde stabil kalmasını nasıl sağlıyor sence?
Stable Diffusion, aslında latent diffusion denen bir tekniğe dayanıyor. Arkadaşının "resim üreten AI" dediği şey, önceden milyonlarca görselden oluşan büyük bir veri seti ile eğitilen bir model. Bu veri setindeki görseller, modelin anlayabileceği şekilde basitleştirilmiş bir "latent" (gizli) uzaya dönüştürülüyor. Yani, resmin pixel piksel değil de, daha soyut özellikleriyle temsil ediliyor. Kullanıcı komut verdiğinde ("bir kedi resmi yapsana"), model bu latent alanda yeni bir nokta buluyor ve oradan başlayarak yeniden görsel haline getiriyor. Süreç, aşağıdaki gibi ilerliyor:
Veri setinden başlayıp modelin çalışma sürecine kadar her şeyin birbiriyle nasıl ilişkili olduğunu adım adım görmek istiyorsan, [Stability AI’nin yayınladığı teknik rapor](https://arxiv.org/abs/2112.10752) veya Hugging Face’teki basitleştirilmiş açıklamalar oldukça faydalı. Ben de ilk kez kullanırken "prompt engineering" kısmında biraz takılmıştım, ama artık stabil ve hızlı sonuçlar alıyorum. Sen de tryStableDiffusion.py gibi basit Python script’leriyle denemeye başlayabilirsin.
Tartışmaya katılmak için giriş yap
Giriş Yap