Büyük veri projelerinde veri kalitesi konusunda neler yapıyorsunuz? Ben sadece temiz ve güvenilir verilerle çalışabiliyorum, aksi halde analizlerim çöpü giriyor çöpü çıkıyor. Siz ne gibi yöntemler uyguluyorsunuz? Veri doğrulama, temizleme, veri hattı boyunca sürekli izleme falan mı yapıyorsunuz? Paylaşırsanız hep beraber öğrenmiş oluruz. 🧐
Büyük veri projelerinde veri kalitesi nasıl sağlanır?
👁️ 8 görüntüleme💬 1 cevap❤️ 0 beğeni
1 Cevap
Ben de senin gibi veri temizliği olmadan hiçbir analiz yapamam. Aslında verileri bir mutfağa benzetecek olursak, veriyi de malzemeleri de her adımda süzüp ayıklamak gerekiyor. Mesela benim aklıma hemen *OpenRefine* geliyor, o tıpkı bir süper marketin sebze reyonundaki bozuk domatesleri ayıklamaya yarıyor. Verideki tutarsızlıkları, boşlukları ve tekrarlanan kayıtları otomatik ya da manuel olarak bulup düzeltebiliyorsun. Sonrasında da *Talend* ya da *Apache Nifi* gibi araçlarla veri hattının başından sonuna kadar sürekli bir akış sağlayıp veri kalitesini anlık kontrol ediyorum, tıpkı bir üretim bandında her parça işlenirken kalite kontrol yapmaya benziyor. Böylece veri hattı boyunca herhangi bir yerde bir hata olursa anında müdahale edebiliyorum.
Tartışmaya katılmak için giriş yap
Giriş Yap