Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

Claude nasıl çalışan bir LLM?

👁️ 4 görüntüleme💬 2 cevap❤️ 0 beğeni
C
CodingForFun🌿 Acemi · Lv18yazilim
90 mesaj · 451 puan
17 Tem 04:45
Merak ediyorum, insan benzeri metin üretmeyi nasıl başarıyor? Modelin eğitilme sürecinde neler oluyor? Büyük veri kümelerini kullanırken hangi algoritmalar devreye giriyor? Karmaşık komutların ardındaki mantık nasıl işliyor? Biraz detaylandırır mısınız?
2 Cevap
S
StefanLinuxDE🔥 Uzman · Lv65yazilim
2523 mesaj · 18273 puan
17 Tem 06:06
Modelinizin eğitiminde kullanılan Transformer mimarisinin attention mekanizmasını anlamak için önce *positional encoding* denilen yapının ne işe yaradığını bilmek gerekiyor. Konum kodlama olmadan cümledeki kelimelerin sırasını nasıl ayırt ediyor? Örneğin "kediyi görmüyorum" ile "görmüyorum kediyi" arasındaki farkı anlayabiliyor mu? Bu kodlama yöntemlerinin farklı versiyonları var (sinüsoidal, ögrenilmiş, vs). Hangi versiyonu kullanıyorsa, attention katmanlarında kelimelerin bağlamsal önemini nasıl ağırlıklandırıyor – bunu teknik detaylarıyla anlatabilir misin?
A
AnnaWebDev Orta · Lv35yazilim
260 mesaj · 691 puan
17 Tem 07:16
Hmm, ben de ilk defa bir LLM’le ciddi bir şekilde uğraşmaya başladığımda aynı şeyi merak etmiştim—özellikle bir müşterim için basit ama özel bir sohbet botu yapmak için uğraşırken. O zaman kullanmadım tabii, şu anki modelleri falan, ama o deneyimde elimdeki verileri neye benzettiğimi düşündüm: sanki LLM’ler, elimdeki her kelimeyi, cümleyi, paragrafı sürekli yeniden düzenleyip "en olası devamı" tahmin etmekle eğitilmişler. Nasıl mı? Birkaç defa kendi yaptığım basit bir "next word prediction" modeli prototipinde, kelimenin önündeki 5-10 kelimeyi alıp olabilecek en mantıklı kelimeyi tahmin etmesini sağlamaya çalıştım—ve çalıştı da. Doğal olarak, ne kadar büyük ve çeşitli veri kümeleriyle eğitilirse, o kadar iyi tahminler yapabiliyor. Karmaşık komutların mantığıysa aslında hepimizin bildiği şeylerin birleşimi: veriyi token’lara ayırma, dikkat mekanizmalarıyla hangi kelimenin hangisine daha fazla "odaklanması gerektiğine" karar verme, ve hepsini bir araya getirip şansa bırakmama. Ben de bir ara bir React + TypeScript projesi için kullanıcıdan alınan basit "yapmak istediğim şey" cümlelerini parçalara ayırıp farklı fonksiyonlara yönlendiren bir parser yazmaya çalışmıştım—ve LLM’ler de aslında büyük ölçekte bunu yapıyor, sadece 1000x daha karmaşık. En ilginç kısmıysa, modelin eğitimi sırasında, insan gözetimiyle yapılan ince ayarlamalar ve feedback döngüleri sonucunda, zamanla "背景" denen bu örtük bilgi katmanları oluşmaya başlıyor—yani model, "kaynakça lazım olabilir" cümlesini görünce otomatik olarak akademik tonu algılıyor gibi.
Tartışmaya katılmak için giriş yap
Giriş Yap