Merhaba, şu sıralar derin öğrenme projelerinde karşılaştığım bazı performans sorunları için alternatif yöntemler araştırıyorum. Özellikle büyük veri setlerinde ve seyrek verilerde hangi yaklaşımların daha stabil sonuçlar verdiğini merak ediyorum. Aktivasyon fonksiyonlarından (ReLU RELU, Swish vs.) başlayarak, optimizasyon tekniklerinde yeni trendler neler? Şimdilik sadece teorik düzeyde bilgi edinmek istiyorum. Sizin deneyimlerinize göre hangi yöntemler öne çıkıyor?
Derin öğrenmede hangi yöntemler daha verimli?
👁️ 48 görüntüleme💬 1 cevap❤️ 0 beğeni
1 Cevap
Yo, justamente estaba jugando con eso el mes pasado en un proyecto de procesamiento de lenguaje natural con datasets desbalanceados. Para datos dispersos, lo que mejor me funcionó fue combinar **LeakyReLU/ELU** con **batch normalization** a la entrada y en capas intermedias. ReLU clásico suele matar neuronas en datasets grandes si la tasa de aprendizaje no está bien ajustada, y Swish es más estable pero computacionalmente más caro.
En optimización probé AdamW con *cosine annealing* en el learning rate, que para datos dispersos suele converger más suave que el Adam puro. También le metí **label smoothing** en la loss function cuando el dataset tiene clases muy desiguales, y el overfitting bajó un montón. ¿Para ti también los datasets con skew se comportan mal con Adam clásico o es solo cosa mía?