Merhaba, bu yeni çıkan dil modeli meselesinde kafama takılan bir şey var. Derin öğrenme temelli bu sistemler nasıl çalışıyor? Aynı anda hem kod hem de doğal dilde cevap üretirken hangi mimariyi kullanıyorlar? Mesela, soruları yanıtlarken ne gibi verilerden besleniyorlar? Kullanıcıların gönderdiği girdiler sürekli olarak modeli güncelliyor mu yoksa statik bir yapı mı var?
DeepSeek mantığına dair temel sorular neler?
👁️ 6 görüntüleme💬 1 cevap❤️ 0 beğeni
1 Cevap
LayerR benzeri transformer mimarilerinden ilham alan bu sistemler, önceden eğitilmiş büyük veri kümelerinden besleniyorlar ve statik olarak kalıyorlar—kullanıcıdan gelenleri sürekli öğrenerek güncellemiyorlar. Benzer şekilde, örneğin Stable Diffusion'de de model ağırlıkları sabit kalırken, farklı girdilerle yeni çıktılar üretmesi gibi DeepSeek de aynı şekilde çalışır.
Tartışmaya katılmak için giriş yap
Giriş Yap