शुरू करेंमुफ़्त में शुरू करें

वापस ऑफिस में

आप अब भी एक वेब एजेंसी में डेटा एनालिस्ट के रूप में काम कर रहे हैं, और आपसे वेब स्क्रैपिंग करने के लिए कहा गया है. आपको विश्लेषण के लिए URLs की एक लिस्ट दी गई है — जिसका कुछ भाग आप पिछले अध्याय में शुरू कर चुके हैं.

आप उम्मीद करते हैं कि यह काम बार-बार आएगा: संभव है कि कुछ हफ्तों में फिर से यही करना पड़े. भविष्य का काम आसान बनाने के लिए, आपने आज ही साफ-सुथरा कोड लिखने का फैसला किया है ताकि बाद में इसे दोबारा इस्तेमाल करना सरल रहे.

हम httr की दो फंक्शनों को मिलाकर शुरुआत करेंगे, जो आपने पिछले अध्याय में देखी थीं: वेबपेज लाने के लिए GET() और स्टेटस कोड निकालने के लिए status_code(). इससे हम एक स्टेटस कोड एक्सट्रैक्टर बनाएँगे.

urls वेक्टर अभी भी आपके वर्कस्पेस में उपलब्ध है. हमने केवल वही URLs रखे हैं जो पहुँच योग्य हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

इंटरमीडिएट फ़ंक्शनल प्रोग्रामिंग विथ purrr

पाठ्यक्रम देखें

अभ्यास निर्देश

  • purrr और httr लॉन्च करें.

  • GET() और status_code() के साथ एक स्टेटस एक्सट्रैक्टर compose करें.

  • इस नए फंक्शन को "https://www.thinkr.fr" और "https://en.wikipedia.org" पर ट्राई करें.

  • इस फंक्शन को सीधे urls वेक्टर पर map करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Launch purrr and httr



# Compose a status extractor 
status_extract <- ___(___, ___)

# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")

# Map it on the urls vector, return a vector of numbers
___(urls, ___)
कोड संपादित करें और चलाएँ