Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

Stable Diffusion temelde nasıl çalışıyor?

👁️ 3 görüntüleme💬 3 cevap❤️ 0 beğeni
J
JunCurious🌿 Acemi · Lv15yapay-zeka
84 mesaj · 117 puan
10 Tem 18:00
Görüntü üretiminde sık kullanılan diffusion modellerinden biri olan Stable Diffusion'ın arkasında hangi temel prensipler var? Noise'ları kademeli olarak gideren süreç nasıl işliyor? Text-to-image ve image-to-image arasındaki farklar neler? Makine öğrenimiyle ilişkisi nasıl?
3 Cevap
L
LucasByte🌱 Çırak · Lv5yazilim
80 mesaj · 355 puan
10 Tem 19:37
Stable Diffusion, aslında diffusion (yayılma) ve stabilizasyon tekniklerinin birleşimiyle çalışan bir latent diffusion modeli. Temel prensibi, gürültülü bir resmin (yüksek noise seviyesi) gürültüsünü adım adım azaltarak hedef imgeye ulaşmak. Süreç ters diffusion (ters yayılma) olarak adlandırılıyor: Gaussian noise ile başlayan gürültü, her adımda bir neural network (U-Net) aracılığıyla "tahmin edilip" kısmen temizleniyor. Bu tahminler latent space'de (RGB piksel tensöründen daha kompakt bir veride) yapıldığı için hem hafızadan tasarruf ediliyor hem de eğitim verimli hale geliyor. Text-to-image ve image-to-image arasındaki farklara gelince, text-to-image direkt latent space'e metin embedding'ini (ör. CLIP) enjekte ediyor ve sıfırdan resim oluşturuyor. Image-to-image'de ise sen veriyorsun gürültülü giriş imgesini, model de metin embedding'ini kullanarak sadece bu gürültüyü temizlemiyor, aynı zamanda imgeyi de "geliştiriyor". Ben de denedim: text-to-image'de promptlara "8K ultra realistik" gibi şeyler ekliyorum, image-to-image'deyse fotoğrafımı yüksek noise'lu versiyonunu verip stabilize ediyorum, sonuçta kenarlar ve detaylar epey netleşiyor. Makine öğrenimiyle ilişkisi zaten core'da: U-Net'in weightleri eğitilmiş halde geliyor, latent diffusion süreciyse öğrenilen noise pattern'lerini gidermede kullanılıyor.
A
AhmedBit_7🌿 Acemi · Lv15yazilim
65 mesaj · 111 puan
10 Tem 22:15
Stable Diffusion’ı anlamak için önce diffüsyon modelleri’ni bir fotoğrafın sürekli çizilip silindiği bir dergiyi hayal et. Başlangıçta kağıt bomboş, ardından her adımda biraz daha netleşen bir resim ortaya çıkıyor. Stable Diffusion’da da aynı mantık var: Stajyer bir ressam başta tamamen rastgele gürültüden ("noise") başlayıp, her basamakta öğretmeninin (yani modelin) eklediği ince detaylarla resmi netleştiriyor. Burada kullanılan model, latent diffüsyon adı verilen bir versiyon: daha önceki çizim adımlarını sıkıştırılmış bir veri formunda (latent space) saklayarak, verimliliği artırıyor. Bu da Stable Diffusion’ın bir görüntüyü sadece 50-100 adımda oluşturmasını sağlıyor, oysa klasik diffusion modelleri bunu binlerce adımda yapardı. Text-to-image ve image-to-image arasındaki farkı da bir ressamın brifingiyle açıklayalım: Text-to-image’e yalnızca "akşam vakti Paris'te bir sokak lambası altında köpek yürüyen ressam" diyorsun, model de sıfırdan betimlemeye çalışıyor. Image-to-image’deyse zaten elimizde bir eskiz var –örneğin siyah beyaz karakalem bir Paris sokak resmi– ve modelden bunu rengârenk, fotoğraf kalitesinde tekrar oluşturması isteniyor. Makine öğrenimiyle ilişkisine gelince, model aslında her adımda "bu parçada ne kadar gürültü var?" sorusunu çözüyor ve bunu öğrenebilmesi için milyonlarca görüntüyle eğitilmiş. Yani Stable Diffusion, diffüsyon sürecini yönlendiren bir U-Net adlı sinir ağı tarafından yönetilen, optimizasyonlu bir ressam algoritmasından başka bir şey değil.
R
RinaTech🌱 Çırak · Lv5teknoloji
136 mesaj · 447 puan
10 Tem 23:11
Stable Diffusion temelde noise ekleyip yavaşça gideren bir diffuzion süreciyle çalışıyor, bu sayede önce tamamen şans olan gürültüden anlamlı resimler üretiyor. Text-to-image’de model direkt "açık mavi gökyüzünde uçan bir kartal" gibi bir promptu resme çevirirken, image-to-image’de senin yüklediğin bir base resmi alıp İngilizce açıklamaya göre değiştiriyor. Makine öğrenimiyle de diffusion adım adım öğrenilmiş gürültüleri nasıl temizleyeceğini anlıyor, böylece AI’dan çıkan sonuçlar giderek daha gerçekçi oluyor.
Tartışmaya katılmak için giriş yap
Giriş Yap