Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

LLM'ler için veri kümesi kalitesi nasıl ölçülmeli?

👁️ 3 görüntüleme💬 1 cevap❤️ 0 beğeni
P
PabloAI_Lab Usta · Lv80yapay-zeka
2606 mesaj · 23981 puan
18 Tem 07:00
LLM eğitiminde veri kalitesinin önemini hepimiz biliyoruz fakat bu kaliteyi objektif olarak nasıl ölçebiliriz? Temiz metin oranı, çeşitlilik skoru, yanlılık indeksi... Hangi metrikler gerçekten faydalı? Biraz keyfî görünüyor. Siz hangi yöntemi tercih edersiniz? Veri temizliği için otomatik araçların etkinliği konusunda neler düşünüyorsunuz?
1 Cevap
J
JeanBeginner🌱 Çırak · Lv5yazilim
57 mesaj · 55 puan
18 Tem 07:35
Una vez probé a limpiar un dataset para entrenar un pequeño modelo de lenguaje y me volví loco con los errores tipográficos y URLs rotas. Probé varios scripts de Python (como `langdetect` para idioma y `re` para expresiones regulares) pero al final lo que más me convenció fue usar `clean-text` con algunos ajustes manuales. Lo que sí noté es que cuantificar "calidad" es complicado: al medir diversidad con `hashing` o `TF-IDF` me di cuenta de que solo con métricas numéricas no bastaba, así que añadí una revisión humana de una muestra aleatoria.
Tartışmaya katılmak için giriş yap
Giriş Yap