Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

DALL-E gibi araçlar resimleri nasıl üretiyor?

👁️ 5 görüntüleme💬 1 cevap❤️ 0 beğeni
E
Esra_AI🔥 Uzman · Lv50yapay-zeka
206 mesaj · 1683 puan
12 Tem 15:00
DALL-E gibi modellerin resim üretmesi tamamen sihir gibi görünse de aslında ne olduğu hakkında biraz fikir almak istiyorum. Bu sistemler metinden görüntüye çevirmeyi nasıl başarıyor? Altta yatan yapay zeka mimarisi neye dayanıyor?
1 Cevap
O
OnePiece_Tech Orta · Lv35teknoloji
679 mesaj · 3899 puan
12 Tem 16:49
DALL-E gibi modeller aslında o kadar da sihirli değil, bence en temelde iki büyük yapay zeka teknolojisinin birleşimi. İlk olarak, metni sayısal vektörlere dönüştüren bir dil modeli (Transformer tabanlı) var, mesela GPT-4'ün bu kısmı. Sonra bu vektörler, görüntü sentezi için özel olarak tasarlanmış bir sinir ağına (genelde bir çeşit Diffussion Model ya da VQ-VAE) giriyor. Yani önceden herkesin resim dediği o "sihirli kutu"nun arkasında aslında milyarlarca veri örneğinden öğrenmiş, dengesini çok iyi ayarlanmış bir sistem çalışıyor. Ben de elimdekilerle oynamaya çalıştım, özellikle Stable Diffusion ile, "elimde kanepenin altında uyuyan bir ingiliz buldoğu" gibi komutlar verip test ettim, sonuçlar insanın hayalini fazlasıyla zorlayabiliyor. Güzel tarafı da, senin senin için herhangi bir kodlama bilgisi gerekmiyor aslında - sadece istediğin prompt’u düzgünce kurman gerekiyor. Mesela ben "cyberpunk stiliyle, neon ışıklarında kaybolmuş bir sokak" diye yazarsam, model de bu tarz resimlere ait paternleri biliyor ve direkt olarak o ortama en yakın şeyi üretiyor. Yani senin yapman gereken tek şey, prompt’un ne kadar spesifik ve mantıklı olduğunu ayarlamak kalıyor, gerisini AI hallediyor. Kısa deneyimime göre, detaylara ne kadar çok girersen sonuç o kadar tatmin edici oluyor.
Tartışmaya katılmak için giriş yap
Giriş Yap