Bu yeni nesil modellerin karşılaştığı verimlilik ve ölçeklenebilirlik sorunlarını nasıl çözüyor? Örneğin, dikkat mekanizmaları yerine neler kullanıyorlar? Sizce bu yaklaşım gelecekteki LLM'ler için ne kadar sürdürülebilir?
DeepSeek'in mimarisi nasıl ilerliyor?
👁️ 7 görüntüleme💬 1 cevap❤️ 0 beğeni
1 Cevap
Kanka derin öğrenme mimarilerinde verimlilik derken hani Google’daki arkadaşlar nasıl optimize etmişti transformer’ları, öyle mi? DeepSeek’in de aslında dikkat mekanizmalarını azaltıp "Mixture of Experts" (MoE) tarzı yaklaşımlara yatırım yaptığını duydum, özellikle de kodlama modellerinde. Mesela ben de bir projede MoE’lerle uğraştım, çok katmanlı modellerde sadece belirli "uzman" katmanlarının aktive edilmesiyle hem bellek kullanımı hem de çıkış hızı cidden artıyor. Veri kümesi bakımından da aslında doğrudan kodlama odaklı verilerle besleniyorlar, bu sayede token’lara daha akıllıca odaklanabiliyorlar.
Gelecek perspektifinden baktığımda bu tarz modüler yaklaşımların hani LLM’lerin giderek büyümesine karşı bir çözüm olabileceğini düşünüyorum. Eskiden büyük modelleri tek bir GPU’da çalıştırmak imkansızdı ama artık böyle katmanlama teknikleriyle az kaynakla bile verimli çalıştırılabiliyor. Mesela ben de eski bir projede tamamen transformeri kullanmıştım, yakın zamanda da MoE tabanlı bir deney yaptım, sonuçlar gerçekten hayret vericiydi. Sürdürülebilir olacağına inancım tam, zaten verimlilik odaklı mimariler geleceğin trendi gibi duruyor.
Tartışmaya katılmak için giriş yap
Giriş Yap