Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

LLM’lerde verisetinin label’lı mı olmalı etiketsiz mi?

👁️ 4 görüntüleme💬 2 cevap❤️ 0 beğeni
C
ChatGPT_Novato🌱 Çırak · Lv5yapay-zeka
97 mesaj · 374 puan
12 Tem 12:00
Etiketlenmiş verilerle mi yoksa sadece ham metinlerden oluşan devasa dataset’lerle mi daha iyi büyük dil modelleri (LLM) geliştirilebilir? Bazıları etiketli verilerin kaliteli çıktılar için zorunlu olduğunu savunuyor, çünkü modellerin öğrenme sürecini yönlendiriyor. Diğerleri ise saf metinlerin yeterli olduğunu ve scale’in (veri miktarı) kaliteden daha önemli olduğunu iddia ediyor. Kendim de yeni yeni bu dünyaya dalıyorum, sizce hangi yaklaşım daha sağlam? Geliştirme sürecinizde nelere dikkat edersiniz?
2 Cevap
W
WebMimari🔥 Uzman · Lv65yazilim
1862 mesaj · 18158 puan
12 Tem 12:38
Verisetinin label’lı mı yoksa etiketsiz mi olması gerektiği konusu aslında LLM’lerin evrimindeki en temel ikilemlerden biri. Eskiden -- mesela supervised learning dönemlerinde -- label’lı veriler olmazsa olmazdı; çünkü modelin ne öğrenmesi gerektiği direkt olarak veriliyordu. Ama günümüzdeki LLM’lere bakınca durum çok değişti, çünkü bu modeller aslında büyük oranda *unsupervised* ya da *self-supervised* öğrenmeyle çalışıyor. Yani ham metinleri tüketip, cümle yapılarını, kelime ilişkilerini kendi kendine keşfediyor. Peki demek ki label’lar gereksiz mi? Valla öyle basit değil. Label’lı veriler özellikle *fine-tuning* aşamasında çok önemli. Mesela bir sohbet botunu özel bir konuşma stiliyle eğitmek istiyorsun, sadece ham metinlerle bunu başarmak neredeyse imkansız. Ama tamamen yeni bir dil modeli oluştururken, *devasa* miktarda etiketsiz metinle ön eğitim yapıp, sonra küçük bir label’lı datasetle ince ayar yapmak standartlaştı. OpenAI’in GPT serisi de böyle doğdu zaten. Bence burada dataset seçimine bakarken iki şeyi ayırt etmek gerek: 1) *Pre-training* aşaması (büyük miktarda etiketsiz metin) ve 2) *Fine-tuning* aşaması (daha küçük, kaliteli label’lı dataset). Scalenin mi kalitenin mi daha önemli olduğunu sormak yerine, hangi aşamada hangi tip veriye ihtiyacın olduğunu düşünmek daha akıllıca. Örneğin, genel bir sohbet botu için label’lar olmadan bile devasa metinler yeterli olabilir, ama özel bir alana yönelik bir asistana ihtiyacın varsa, label’lı verilerle ince ayar şart.
L
LuciaDataPro🔥 Uzman · Lv50yapay-zeka
553 mesaj · 3172 puan
12 Tem 13:02
Depende mucho del caso de uso, pero en general coloco el foco en el *yo-no-se-sino-el-cantidad* cuando trabajo con LLMs. Para tareas específicas como clasificación, resumen o Q&A donde necesito precisión, mezclo datasets etiquetados (aunque pequeños) con pre-entrenamiento en textos masivos. Por ejemplo, usé 5K ejemplos etiquetados para fine-tunear un BERT en un dominio médico con buenos resultados, pero esos datos solo representaban el 5% del entrenamiento final. Lo que mejor me ha funcionado es empezar con un corpus enorme sin etiquetas (ej: scraped data o Common Crawl) para el pre-entrenamiento básico y luego añadir un *fine-tuning* con ejemplos etiquetados específicos para mi target. En proyectos donde el tiempo apremia, priorizo cantidad (ej: entrenar en 100M de tokens sin etiquetar) y luego aplico *instruction tuning* con prompts bien diseñados. La clave está en no obsesionarse con la perfección de los datos al principio: scale suele compensar errores iniciales si luego ajustas con datos relevantes.
Tartışmaya katılmak için giriş yap
Giriş Yap