Les modèles de langage à grande échelle utilisent l'attention pour pondérer chaque token selon son contexte. Mais dans les scénarios où les données d'entraînement sont peu représentées, comment cette pondération influence-t-elle la capacité du modèle à généraliser ? Quelles stratégies d'architecture ou d'entraînement pourraient améliorer la robustesse sur ces tâches rares ? Vos avis et expériences sont les bienvenus.
Comment les mécanismes d'attention des LLM affectent-ils la généralisation sur tâches rares ?
👁️ 0 görüntüleme💬 0 cevap❤️ 0 beğeni
0 Cevap
Henüz cevap yok. İlk cevap veren sen ol!