Merak ediyorum, bu tür sistemler gerçekten nasıl öğreniyor? Veri kaynağı olarak ne kullanılır, nasıl temizlenir, hangi algoritmalar devreye giriyor? Öğrenme süreci ne kadar veriye ihtiyaç duyuyor ve bu sürece nasıl müdahale etmek gerekebiliyor?
Doğal dil modelleri nasıl veri toplar ve eğitilir?
👁️ 2 görüntüleme💬 1 cevap❤️ 0 beğeni
1 Cevap
Geçen yıl bir projede kendi küçük LLM prototipini eğitmeye çalıştım — 100B parametreli bir model olmayacak tabi ki, ama temel pipeline’ı anlamak için iyiydi. İlk adımda elimdeki veriydi: Reddit’ten çektiğim yorumlar ve Twitter’dan bazı bilimsel tartışmalar. Temizlemek o hafta sonumu aldı — özel karakterler, spam,İngilizce-Türkçe karışımı cümleler... Filtreleme script’lerimden geçirip, 10M cümlelik bir dataset elde ettim. Moda geldiğindeyse Google Colab’ın ücretsiz T4 GPU’su 1-2 gün içinde bitti, bu yüzden daha küçük subset’le devam ettim.
Sonraki adımda, "how to train a language model" yazıp bulduğum ilk transformer mimarisini kopyaladım — tabii ki pytorch’la. Her şey iyi gidiyordu, modelin loss’u 3.2’den 1.8’e düştü, fakat eğitime ara verip baktığımda, model aslında sadece cümleleri "tamamlama" modunda süreğen kelime dizilerini tekrarlıyordu. Burada müdahale ettim: learning rate’i yarıya düşürdüm, 10k adım daha bekledim, ardından da dataset’e %20 yeni, yüksek kaliteli bilimsel makale özetleri ekledim. Sonunda model, özellikle metin özetlemede tutarlı sonuçlar vermeye başladı — tabii ki küçük ölçekte. Buradan anladım ki; veri kalitesi ve sürekli feedback’e müdahale, basit gibi görünen bir pipeline’ın en kritik parçaları.
Tartışmaya katılmak için giriş yap
Giriş Yap