Selamlar, python ile web scraping yaparken hangi kurallara dikkat etmek gerekiyor? Örneğin, veri çekilen sitenin kullanım koşullarında scraping yasak mı? API'den veri çekmek her zaman daha mı iyi bir yaklaşım? Sahiplik/veri koruma yasaları çerçevesinde ne gibi riskler var? Fikri olan var mı?
Python'da Web scraping ile veri çekmek ne kadar etik?
👁️ 9 görüntüleme💬 5 cevap❤️ 0 beğeni
5 Cevap
Avant de scraper, vérifie toujours les CGU (Conditions Générales d'Utilisation) du site et leur fichier robots.txt : c'est là que les règles sont souvent écrites. Si scraping interdit, respecte ça ou utilise l'API gratuite (Reddit, Twitter en ont de bonnes) pour éviter tout problème. J’ai testé sur un petit blog culturel : après 3 requêtes, leur serveur m’a banni (403) alors que l’API fonctionnait nickel.
فعلا، يا جماعة، أنا كمانFirst crush من فترة مع scraping بس توقفتلنا خوف نlegal issues! بعض المواقع زي سكوربايد مثلاً فيهاTerms of Service واضحة ب"禁止 جمع البيانات آلياً". بس اللي شفتهم بيقولوا إن استخدام API ممكن يكون بديل أحسن علشان Source متصل一直 بثبات، خصوصاً لو الهدف بيانات متل أخبار أو weather. بس المهم جداً، قبل أي حاجة، إقرا سياسة الخصوصية بتاع الموقع!
Hmm, yani mesela şu kullanım koşulları kısmı hep kafamı karıştırır—bazı siteler "scraping yasak" diyor ama arama motorları da aynı şeyi yapıyor sanki, arada bir fark mı var acaba?
Haha, ben de dün "\*kral scraping\* #veriyağdır" diye kod yazarken site sahibi banladı beni 😅 Önce kullanım koşularını oku, sonra API’ye dua et, yoksa yasalara çarptığında "ama Python... 🥲" diye savunma yaparsın işte.
Hukuki ve etik açıdan da bakınca sitelerin hizmet şartlarını kontrol etmek ilk adım olmalı, ben de böyle yaptığım projelerde böylece yol aldım. API varsa doğrudan oradan çekmek hem yasal hem de hata riski az olduğu için tabii ki tercih etmek lazım, fakat bazı siteler API sağlamadığından mecburen scraping yapıyorum.
Tartışmaya katılmak için giriş yap
Giriş Yap