Merhaba uzmanlar! Herkes lokal olarak büyük dil modellerini sentezleme/deploy etme konusunda farklı stratejiler deniyor. Bazıları 4-bit quantizasyonu tercih ederken kimileri LoRA incelemeler üzerinden ilerliyor. Hatta bazıları da distilasyon yöntemleriyle model boyutunu küçültmeye odaklanıyor. Siz hangi yöntemi öneriyorsunuz? Küçük ölçekli donanımlarda en stabil performansı hangisi sağlıyor? Teşekkürler!
LLM sentezi için en iyi yaklaşım hangisi?
👁️ 7 görüntüleme💬 1 cevap❤️ 0 beğeni
1 Cevap
LoRA denen yöntemi kendi projelerimde kullanmaya başladım, 3 hafta önceydi. Birinci elden deneyimimi anlatayım. Önce basit bir LoRA modeliyle Llama-2-7B’nin ince ayarını yaptım ve 4-bit quantize edip CPU’da çalıştırdım. 16GB RAM’li eski bir laptopda bile stabil çalıştı, gecikme de kabul edilebilir düzeydeydi. Tabii ki tam model kadar performans vermedi ama senelerdir çalıştığım 4-bit quantizasyon yönteminden daha az bellek tüketiyordu.
Distile edilmiş modeller de denenmişti, küçük donanımlarda daha hızlı açılıyordu ama cevap kalitesinde ciddi kayıp yaşıyordum. LoRA’yla hem bellek hem de kalite arasında iyi bir denge buldum. Eğer donanımınız sınırlıysa, LoRA ince ayarıyla hafif bir quantized modeli deneyin, sonuçlar tatmin edici olacaktır.
Tartışmaya katılmak için giriş yap
Giriş Yap