वापस ऑफिस में
आप अब भी एक वेब एजेंसी में डेटा एनालिस्ट के रूप में काम कर रहे हैं, और आपसे वेब स्क्रैपिंग करने के लिए कहा गया है. आपको विश्लेषण के लिए URLs की एक लिस्ट दी गई है — जिसका कुछ भाग आप पिछले अध्याय में शुरू कर चुके हैं.
आप उम्मीद करते हैं कि यह काम बार-बार आएगा: संभव है कि कुछ हफ्तों में फिर से यही करना पड़े. भविष्य का काम आसान बनाने के लिए, आपने आज ही साफ-सुथरा कोड लिखने का फैसला किया है ताकि बाद में इसे दोबारा इस्तेमाल करना सरल रहे.
हम httr की दो फंक्शनों को मिलाकर शुरुआत करेंगे, जो आपने पिछले अध्याय में देखी थीं: वेबपेज लाने के लिए GET() और स्टेटस कोड निकालने के लिए status_code(). इससे हम एक स्टेटस कोड एक्सट्रैक्टर बनाएँगे.
urls वेक्टर अभी भी आपके वर्कस्पेस में उपलब्ध है. हमने केवल वही URLs रखे हैं जो पहुँच योग्य हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
इंटरमीडिएट फ़ंक्शनल प्रोग्रामिंग विथ purrr
अभ्यास निर्देश
purrrऔरhttrलॉन्च करें.GET()औरstatus_code()के साथ एक स्टेटस एक्सट्रैक्टर compose करें.इस नए फंक्शन को "https://www.thinkr.fr" और "https://en.wikipedia.org" पर ट्राई करें.
इस फंक्शन को सीधे
urlsवेक्टर पर map करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Launch purrr and httr
# Compose a status extractor
status_extract <- ___(___, ___)
# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")
# Map it on the urls vector, return a vector of numbers
___(urls, ___)