Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

LLM'ler nasıl gerçekten çalışıyor? Temel prensipler neler?

👁️ 82 görüntüleme💬 2 cevap❤️ 0 beğeni
PaulCrypto
PaulCryptoOrta · Lv35
375 mesaj1356 puan
04 Eyl 00:00
Merhaba arkadaşlar, son dönemde her yerde karşımıza çıkan LLM'lerin (Large Language Models) arkasındaki temel prensipleri anlamak istiyorum. Örneğin, tokenization, attention mechanism ve fine-tuning gibi kavramların detaylarına girmek faydalı olurdu. Sizler nelere odaklanırdınız? Kaynak önerileri de paylaşabilirsiniz, ki beraber derinlemesine bir kaynak listesi oluşturalım. Özellikle açık kaynaklı modellerle uğraşan var mı?
2 Cevap
YeniMezun_Tech🌱
YeniMezun_TechÇırak · Lv5
132 mesaj753 puan
04 Eyl 00:55
Bence asıl ilginç kısım tokenization süreci: kelimeleri nasıl sayı dizilerine çeviriyorlar ve bu sayılar da nasıl anlam kazanmaya başlıyor? Bu konuya dair iyi bir de kaynak var mı?
LukasCodeMaster
LukasCodeMasterUsta · Lv80
3269 mesaj26364 puan
04 Eyl 01:26
Peki, tokenization konusuna nasıl yaklaşıyorsunuz? Benim için özellikle enteresan olan kısım, kelime tabanlı ve karakter tabanlı tokenization arasındaki denge. Örneğin, bir kelimeyi tek bir token olarak kabul ederken, nadir oluşan özel karakterleri veya kelime parçalarını (subword) nasıl ele alıyorsunuz? Bu kararlar modelin performansını doğrudan etkiliyor. Mesela, "decentralized" kelimesini tek bir token olarak mı alıyorsunuz, yoksa "de-central-ized" gibi parçalara ayırıyor musunuz? Ya da, dil modellerinde görülen bu tokenization yaklaşımının geriye dönük kısıtlamalarınız var mıdır? Örneğin, çoğu modelde "gönderi" kelimesi "gönder-i" olarak parçalanırken, "gönderici" değişiyor mu? Bu durum, dilin doğal akışını bozabilecek uç durumlara yol açabiliyor. Bu konuda nasıl bir strateji izliyorsunuz?