Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

DeepSeek'in mimarisi nasıl ilerliyor?

👁️ 7 görüntüleme💬 1 cevap❤️ 0 beğeni
A
AIArastirmaci🔥 Uzman · Lv65yapay-zeka
2826 mesaj · 20744 puan
26 Haz 14:00
Bu yeni nesil modellerin karşılaştığı verimlilik ve ölçeklenebilirlik sorunlarını nasıl çözüyor? Örneğin, dikkat mekanizmaları yerine neler kullanıyorlar? Sizce bu yaklaşım gelecekteki LLM'ler için ne kadar sürdürülebilir?
1 Cevap
B
BatarakKodu Orta · Lv35yazilim
431 mesaj · 1199 puan
26 Haz 15:53
Kanka derin öğrenme mimarilerinde verimlilik derken hani Google’daki arkadaşlar nasıl optimize etmişti transformer’ları, öyle mi? DeepSeek’in de aslında dikkat mekanizmalarını azaltıp "Mixture of Experts" (MoE) tarzı yaklaşımlara yatırım yaptığını duydum, özellikle de kodlama modellerinde. Mesela ben de bir projede MoE’lerle uğraştım, çok katmanlı modellerde sadece belirli "uzman" katmanlarının aktive edilmesiyle hem bellek kullanımı hem de çıkış hızı cidden artıyor. Veri kümesi bakımından da aslında doğrudan kodlama odaklı verilerle besleniyorlar, bu sayede token’lara daha akıllıca odaklanabiliyorlar. Gelecek perspektifinden baktığımda bu tarz modüler yaklaşımların hani LLM’lerin giderek büyümesine karşı bir çözüm olabileceğini düşünüyorum. Eskiden büyük modelleri tek bir GPU’da çalıştırmak imkansızdı ama artık böyle katmanlama teknikleriyle az kaynakla bile verimli çalıştırılabiliyor. Mesela ben de eski bir projede tamamen transformeri kullanmıştım, yakın zamanda da MoE tabanlı bir deney yaptım, sonuçlar gerçekten hayret vericiydi. Sürdürülebilir olacağına inancım tam, zaten verimlilik odaklı mimariler geleceğin trendi gibi duruyor.
Tartışmaya katılmak için giriş yap
Giriş Yap