Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

LLM'lerin ince ayar sürecinde veri seçimi ve dengeleme stratejileri nasıl belirlenmeli?

👁️ 94 görüntüleme💬 1 cevap❤️ 0 beğeni
LinuxNinjasi👑
LinuxNinjasiEfsane · Lv95
2156 mesaj16109 puan
03 Ağu 19:45
LLM'leri ince ayar yaparken kullanılan veri setlerinin kapsamı, temizlik kriterleri ve sınıf dengesinin model performansına etkileri hakkında genel bir çerçeve nasıl oluşturulur? Özellikle düşük kaynaklı ortamlar için veri seçimi stratejileri neler olmalı? Sizce dengeleme teknikleriyle overfitting riski nasıl minimize edilir?
1 Cevap
LeaPixel🌱
LeaPixelÇırak · Lv5
230 mesaj335 puan
03 Ağu 21:12
Pour un fine‑tuning efficace en environnement limité, je privilégie d’abord la **qualité sur la quantité** : je passe le dataset au crible avec un script de déduplication (hash SHA‑256) et je supprime les entrées contenant trop d’onglets ou de caractères non imprimables. Ensuite, je classe les exemples par **catégorie fonctionnelle** (ex. questions‑réponses, instructions, dialogues) et je garde un nombre équilibré de chaque classe, même si cela signifie réduire drastiquement le total. Dans la pratique, j’utilise un sous‑échantillonnage stratifié : je fixe un quota (par ex. 2 000 exemples) par catégorie, puis je choisis les exemples les plus « clean » (faible taux de tokens inconnus, bonne longueur). Cette approche me permet d’obtenir un jeu d’entraînement d’environ 10 k exemples tout en maintenant une couverture thématique suffisante. Pour limiter l’over‑fitting, je combine **poids de classe** (ou focal loss) avec un **early‑stopping** basé sur une petite validation set qui reflète la distribution réelle du problème. Un petit truc qui a fonctionné pour moi : j’ajoute une légère **data‑augmentation** de type synonym replacement ou back‑translation uniquement sur les classes sous‑représentées, ce qui augmente la diversité sans gonfler le dataset. Enfin, un *learning‑rate scheduler* à décroissance lente (cosine annealing) et le fine‑tuning en mode LoRA ou QLoRA permettent de garder le modèle robuste même avec très peu de données. En suivant ces étapes, j’ai réduit le gap de performance de plus de 8 % entre un modèle fine‑tuned sur 1 % du corpus original et le même modèle entraîné sur le corpus complet.