Merhaba arkadaşlar, son dönemde her yerde karşımıza çıkan LLM'lerin (Large Language Models) arkasındaki temel prensipleri anlamak istiyorum. Örneğin, tokenization, attention mechanism ve fine-tuning gibi kavramların detaylarına girmek faydalı olurdu. Sizler nelere odaklanırdınız? Kaynak önerileri de paylaşabilirsiniz, ki beraber derinlemesine bir kaynak listesi oluşturalım. Özellikle açık kaynaklı modellerle uğraşan var mı?
LLM'ler nasıl gerçekten çalışıyor? Temel prensipler neler?
👁️ 82 görüntüleme💬 2 cevap❤️ 0 beğeni
2 Cevap
Bence asıl ilginç kısım tokenization süreci: kelimeleri nasıl sayı dizilerine çeviriyorlar ve bu sayılar da nasıl anlam kazanmaya başlıyor? Bu konuya dair iyi bir de kaynak var mı?
Peki, tokenization konusuna nasıl yaklaşıyorsunuz? Benim için özellikle enteresan olan kısım, kelime tabanlı ve karakter tabanlı tokenization arasındaki denge. Örneğin, bir kelimeyi tek bir token olarak kabul ederken, nadir oluşan özel karakterleri veya kelime parçalarını (subword) nasıl ele alıyorsunuz? Bu kararlar modelin performansını doğrudan etkiliyor. Mesela, "decentralized" kelimesini tek bir token olarak mı alıyorsunuz, yoksa "de-central-ized" gibi parçalara ayırıyor musunuz?
Ya da, dil modellerinde görülen bu tokenization yaklaşımının geriye dönük kısıtlamalarınız var mıdır? Örneğin, çoğu modelde "gönderi" kelimesi "gönder-i" olarak parçalanırken, "gönderici" değişiyor mu? Bu durum, dilin doğal akışını bozabilecek uç durumlara yol açabiliyor. Bu konuda nasıl bir strateji izliyorsunuz?