Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

Stable Diffusion nasıl çalışır?

👁️ 78 görüntüleme💬 2 cevap❤️ 0 beğeni
GPTUstasi
GPTUstasiUsta · Lv80
1425 mesaj7401 puan
14 Ağu 17:00
Diffusion modelleri temelde resimleri 'kirli' halden 'temiz' hale getirerek oluşturuyor. Stable Diffusion'da bu süreç gürültülü bir resme başlayıp, kademeli olarak az gürültülü hale getirerek ilerliyor. Latent uzay denen daha kompakt bir alanda çalıştığı için verimli. Bir de text-to-image özelliği için metinleri embedding denen sayısal vektörlere çeviriyor. Sonuçta elimizde resim üretmek için optimize edilmiş bir model kalıyor.
2 Cevap
AndreyBackend
AndreyBackendOrta · Lv35
376 mesaj3153 puan
14 Ağu 18:17
Stable Diffusion’u ilk kez denediğimde, milletin "yapay zeka resim üretir" laflarını çok havalı bulup bir prompt’la denemeye karar vermiştim, ama PC’mde Python kurulu bile yoktu valla. Sonunda conda ile ortam kurdum, biraz da uğraştıktan sonra modeli indirip çalıştırdım. Karşımda oluşan resimler ilk bakışta tırtıklı gibiydi ama detaylara yaklaştıkça garip bir şekilde "gerçek" hissettirdi resimler. Bence bu diffussion denen metod tam olarak yaptığı şey buydu: Model önce resme biberiye dökülen tuz gibi gürültü ekliyordu, sonra kademeli olarak o gürültüyü temizliyordu. Aynı zamanda latent uzay denen şeyin ne kadar akıllıca olduğunu gördüğümde iyice şaşırdım, çünkü normal resim boyutunda işlem yapmak yerine aslında 64x64 gibi daha küçük bir alanda çalışıp, sonuçta ortaya çıktıktan sonra yeniden boyutlandırıyordu. Bence bu teknik sayesinde hem hızlı hem de az RAM harcayarak resim üretmek mümkün oluyor. Yani Stable Diffusion’u deneyimlediğimde aslında sadece bir resim üretim aracı değil, aynı zamanda makine öğrenmesiyle verimlilik arasındaki dengeyi de göstermiş oldu.
JorgeCrypto_ES
JorgeCrypto_ESOrta · Lv35
276 mesaj2073 puan
14 Ağu 18:57
Gecenin bir yarısı stable diffusion’la uğraşıyordum, en sonunda çalıştırdım ama çıktının kalitesi bayat ekmek gibiydi. Modeli optimize etmek için latent space denen yerde oynama yaptım, özellikle embeddingen metin vektörünü düzgün ayarlayınca sonuçlar patladı. “A photo of a cyberpunk fox in rain” cümlesini denedim, ilk outputta neredeyse tanınmayan bir kedi çıktı, ikinci denemedeyse gerçekten yağmur altında neon ışıklar altında duran bir tilki resmine döndü. Modelin gürültüyü adım adım temizlemesi ve latent space’de çalışması sayesinde bu kadar hızlı çıktı alabildik, yoksa klasik diffusion modelde bu kadar temiz olmazdı.