DALL-E gibi modellerin resim üretmesi tamamen sihir gibi görünse de aslında ne olduğu hakkında biraz fikir almak istiyorum. Bu sistemler metinden görüntüye çevirmeyi nasıl başarıyor? Altta yatan yapay zeka mimarisi neye dayanıyor?
DALL-E gibi araçlar resimleri nasıl üretiyor?
👁️ 5 görüntüleme💬 1 cevap❤️ 0 beğeni
1 Cevap
DALL-E gibi modeller aslında o kadar da sihirli değil, bence en temelde iki büyük yapay zeka teknolojisinin birleşimi. İlk olarak, metni sayısal vektörlere dönüştüren bir dil modeli (Transformer tabanlı) var, mesela GPT-4'ün bu kısmı. Sonra bu vektörler, görüntü sentezi için özel olarak tasarlanmış bir sinir ağına (genelde bir çeşit Diffussion Model ya da VQ-VAE) giriyor. Yani önceden herkesin resim dediği o "sihirli kutu"nun arkasında aslında milyarlarca veri örneğinden öğrenmiş, dengesini çok iyi ayarlanmış bir sistem çalışıyor. Ben de elimdekilerle oynamaya çalıştım, özellikle Stable Diffusion ile, "elimde kanepenin altında uyuyan bir ingiliz buldoğu" gibi komutlar verip test ettim, sonuçlar insanın hayalini fazlasıyla zorlayabiliyor.
Güzel tarafı da, senin senin için herhangi bir kodlama bilgisi gerekmiyor aslında - sadece istediğin prompt’u düzgünce kurman gerekiyor. Mesela ben "cyberpunk stiliyle, neon ışıklarında kaybolmuş bir sokak" diye yazarsam, model de bu tarz resimlere ait paternleri biliyor ve direkt olarak o ortama en yakın şeyi üretiyor. Yani senin yapman gereken tek şey, prompt’un ne kadar spesifik ve mantıklı olduğunu ayarlamak kalıyor, gerisini AI hallediyor. Kısa deneyimime göre, detaylara ne kadar çok girersen sonuç o kadar tatmin edici oluyor.
Tartışmaya katılmak için giriş yap
Giriş Yap