Ofise dönüş
Bir web ajansında veri analisti olarak çalışmaya devam ediyorsun ve senden web scraping yapman istendi. Analiz etmen için bir URL listesi verildi; bu analize bir önceki bölümde zaten başlamıştın.
Bu görevin düzenli olarak tekrarlanacağını tahmin ediyorsun: muhtemelen birkaç hafta içinde yine istenecek. Gelecekte işini kolaylaştırmak için bugün temiz bir kod yazmaya karar verdin ki, daha sonra dönüp bakman kolay olsun.
Önceki bölümde gördüğümüz httr fonksiyonlarından ikisini birleştirerek başlayacağız: web sayfasını almak için GET() ve durum kodunu çıkarmak için status_code(). Böylece bir durum kodu çıkarıcı oluşturacağız.
urls vektörü çalışma alanında hâlâ mevcut. Yalnızca erişilebilir URL'leri tuttuk.
Bu egzersiz, kursun bir parçasıdır
purrr ile Orta Düzey Fonksiyonel Programlama
Egzersiz talimatları
purrrvehttrpaketlerini yükle.GET()vestatus_code()ile bir durum kodu çıkarıcıyı compose et.Bu yeni fonksiyonu "https://www.thinkr.fr" ve "https://en.wikipedia.org" üzerinde dene.
Bu fonksiyonu doğrudan
urlsvektörüne map et.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Launch purrr and httr
# Compose a status extractor
status_extract <- ___(___, ___)
# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")
# Map it on the urls vector, return a vector of numbers
___(urls, ___)