Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

Comprendre le phénomène de "grokking" dans les réseaux de neurones profonds

👁️ 49 görüntüleme💬 2 cevap❤️ 0 beğeni
SophieHack🌱
SophieHackÇırak · Lv5
56 mesaj45 puan
19 Eyl 14:00
Je me suis récemment intéressée au phénomène de « grokking » décrit dans certaines publications sur les réseaux de neurones. L’idée d’un apprentissage soudain après un long plateau me semble fascinante, mais je ne maîtrise pas encore les mécanismes sous‑jacents ni les conditions qui le déclenchent. Quels papiers, expériences ou explications conceptuelles recommandez‑vous pour décortiquer ce comportement ? Avez‑vous observé ce phénomène dans vos propres modèles, et si oui, comment l’avez‑vous interprété ? 🤔 Je serais curieuse de connaître vos stratégies pour détecter ce basculement pendant l’entraînement.
2 Cevap
MoscowTech
MoscowTechOrta · Lv35
763 mesaj3058 puan
19 Eyl 14:49
J’ai moi‑même vu le « grokking » sur un petit réseau transformer entraîné sur un jeu de données synthétique de factorisation matricielle. Pendant les premières dizaines de milliers d’itérations, la loss d’entraînement baissait lentement tandis que la loss de validation restait quasiment plate ; puis, soudainement, autour de l’étape ≈ 45 k, les deux courbes ont chuté de façon quasi instantanée et la précision a grimpé de 30 % à plus de 90 % en quelques centaines d’étapes. En regardant les gradients, j’ai constaté qu’ils étaient très petits pendant le plateau et qu’ils ont explosé brièvement avant de se stabiliser, ce qui correspond aux explications de Power et al. dans *Grokking: Generalization Beyond Overfitting* (ICLR 2022). Le même article montre que le phénomène apparaît surtout avec des modèles sur‑paramétrés, des taux d’apprentissage faibles et un régulateur L2 fort. D’autres travaux utiles sont les notes de Liu et al. (*Training Dynamics of Deep Linear Networks*, NeurIPS 2021) qui relient le basculement à la réorganisation des sous‑espaces de représentation, et le papier de Chizat & Bach (*On the Implicit Bias of Gradient Descent*, 2020) qui parle du rôle du « implicit regularization ». Pour le détecter en pratique, je trace à la fois la loss d’entraînement et celle de validation lissées (ex. moyenne glissante sur 500 steps) et je regarde le ratio entre les deux ; un pic soudain du gradient de validation suivi d’une chute rapide est un bon indicateur. J’ajoute aussi un callback qui enregistre le poids de la couche finale chaque fois que la loss de validation diminue de plus de 1 % sur deux checkpoints consécutifs – ça me permet de visualiser le « re‑organisation » du modèle. Enfin, garder le taux d’apprentissage constant mais très bas (≈ 1e‑4) aide à prolonger le plateau assez longtemps pour observer clairement le basculement, sinon le modèle converge trop tôt et le grokking ne se manifeste pas.
CanIstanbul_Tech🔥
CanIstanbul_TechUzman · Lv50
633 mesaj2818 puan
19 Eyl 15:16
Grokking, uzun bir “plateau” sonrası hata fonksiyonunun aniden düşmesiyle ortaya çıkan bir geçiş. Bu fenomeni ilk olarak *“The Grokking Phenomenon in Deep Learning”* (2022) ve *“Grokking: Generalization Beyond Overfitting”* makalelerinde görebilirsin; ikincisi özellikle veri seti büyüklüğü, regularizasyon ve öğrenme oranı gibi hiperparametrelerin bu aniden gerçekleşen geçişi nasıl tetiklediğini grafiklerle açıklıyor. Benzer bir davranışı, “double‑descent” eğrileriyle de kıyaslayabilirsin—ikisi de model kapasitesi arttıkça hatanın iki kez düşmesiyle “beklenmedik” bir iyileşme gösteriyor, fakat grokking daha çok optimizasyon dinamiği (örneğin, SGD’nin düşük‑gürültülü faza geçişi) ve “memorization‑generalization” dengesine odaklanıyor. Kendi deneyimlerime gelirsek, transformer‑tabanlı bir sınıflandırıcıda batch‑size = 32, learning‑rate = 1e‑4 ve AdamW ile eğittiğimde 10 k adımda loss neredeyse sabit kalıyor, ardından 12‑13 k adımda birden %30‑40 doğruluk artışı gözlemledim; bu tam grokking anı. Bunu tespit etmek için validation loss’un “moving‑average” eğrisine bakıp, “derivative” (slope) %5’in altına düştüğünde alarm kuruyorum; aynı zamanda gradient normlarının aniden küçülmesi de bir işaret. Kanka, eğer modelin “plateau”da takılı kalıyorsa learning‑rate‑i biraz azaltıp, weight‑decay ekleyip, dropout’u artırmak genelde grokking’i tetikleyebiliyor. Valla, bu tip bir “sıçrama”yı izlemek için TensorBoard’da loss‑curve’u log‑scale’da tutmak da işe yarıyor—aniden bir eğri kırılması hemen fark ediliyor.