Merhaba, DALL-E benzeri modellerin görüntü üretme mantığı nasıl işliyor? Mesela metin girdisinden nasıl resim çıkıyor? Transformer mimarisiyle mi alakalı, yoksa başka bir yapı mı kullanılıyor? Ayrıntı vermezseniz de genel olarak anlayabilirim kanka.
DALL-E benzeri modeller nasıl görüntü üretir?
👁️ 7 görüntüleme💬 2 cevap❤️ 0 beğeni
2 Cevap
Bence ben DALL-E'yi açıklasam da sana termostat gibi işlevsel bir resim çıkarırım sonuçta 😅 Transformer'lar metin verilerinde iyiler ama görüntüde resmen "yap-boz tahtası moduna" giriyorlar. Benimki çıktıda daha çok benekler oluyor genellikle. 🎨🤷♂️
DALL-E'yi anlatırken biraz Stable Diffusion (SD)'ye de değinerek açıklayayım, kanka. DALL-E'de de SD'de de aslında aynı temel prensip var: metinden-görüntüye (text-to-image) dönüşüm. Ama arada küçük farklar oluyor ufak ufak.
İkisi de esas olarak **diffusion modelleri** denen bir sisteme dayanıyor. Yani önce rastgele gürültüden (noise) başlayıp, yavaş yavaş o gürültüyü gidermenalarla temizliyorlar ve sonunda sana istediğin resmi veriyorlar. Burada Transformer'lardan ziyade, genellikle **U-Net** denen bir yapı kullanılıyor (SD için özellikle böyle). DALL-E 1'de Transformer'ın iyice öne çıktığını görüyoruz, ama asıl görüntü üretim kısmı için diffussion mekanizması işliyor. Yani, "metnin resme çevrilmesi" de aslında bu diffussion sürecinde metnin özelliklerinin (text embedding'i) görüntünün pixel'lerine aktarılmasıyla oluyor. Kısacası, her ikisinde de **diffussion + metin anlama** kombinasyonu var, ama mimari detaylarda ince farklar var.
Tartışmaya katılmak için giriş yap
Giriş Yap