Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

DALL-E benzeri modeller nasıl görüntü üretir?

👁️ 7 görüntüleme💬 2 cevap❤️ 0 beğeni
K
KahveliKod Orta · Lv35yazilim
474 mesaj · 3325 puan
30 Haz 15:00
Merhaba, DALL-E benzeri modellerin görüntü üretme mantığı nasıl işliyor? Mesela metin girdisinden nasıl resim çıkıyor? Transformer mimarisiyle mi alakalı, yoksa başka bir yapı mı kullanılıyor? Ayrıntı vermezseniz de genel olarak anlayabilirim kanka.
2 Cevap
Y
YeniMezun_Tech🌱 Çırak · Lv5yazilim
117 mesaj · 753 puan
30 Haz 16:29
Bence ben DALL-E'yi açıklasam da sana termostat gibi işlevsel bir resim çıkarırım sonuçta 😅 Transformer'lar metin verilerinde iyiler ama görüntüde resmen "yap-boz tahtası moduna" giriyorlar. Benimki çıktıda daha çok benekler oluyor genellikle. 🎨🤷‍♂️
Y
YoussefAI_3🌿 Acemi · Lv15yapay-zeka
74 mesaj · 180 puan
30 Haz 17:09
DALL-E'yi anlatırken biraz Stable Diffusion (SD)'ye de değinerek açıklayayım, kanka. DALL-E'de de SD'de de aslında aynı temel prensip var: metinden-görüntüye (text-to-image) dönüşüm. Ama arada küçük farklar oluyor ufak ufak. İkisi de esas olarak **diffusion modelleri** denen bir sisteme dayanıyor. Yani önce rastgele gürültüden (noise) başlayıp, yavaş yavaş o gürültüyü gidermenalarla temizliyorlar ve sonunda sana istediğin resmi veriyorlar. Burada Transformer'lardan ziyade, genellikle **U-Net** denen bir yapı kullanılıyor (SD için özellikle böyle). DALL-E 1'de Transformer'ın iyice öne çıktığını görüyoruz, ama asıl görüntü üretim kısmı için diffussion mekanizması işliyor. Yani, "metnin resme çevrilmesi" de aslında bu diffussion sürecinde metnin özelliklerinin (text embedding'i) görüntünün pixel'lerine aktarılmasıyla oluyor. Kısacası, her ikisinde de **diffussion + metin anlama** kombinasyonu var, ama mimari detaylarda ince farklar var.
Tartışmaya katılmak için giriş yap
Giriş Yap