शुरू करेंमुफ़्त में शुरू करें

एक कंटेंट एक्सट्रैक्टर

पिछले अभ्यासों में, आपने जाँच लिया है कि दिए गए URLs वेक्टर के सभी एलिमेंट 200 स्टेटस कोड लौटाते हैं। अब जब आप जानते हैं कि वे एक्सेसिबल हैं, तो आप वेब स्क्रैपिंग को थोड़ा और आगे बढ़ाते हुए कुछ कंटेंट एक्सट्रैक्शन करेंगे.

इसके लिए हम rvest पैकेज के फंक्शनों का उपयोग करेंगे, जिन्हें partial() से प्रीफिल किया जाएगा। इस अभ्यास में हम जो फंक्शन लिखेंगे, वे किसी पेज से सभी H2 HTML नोड्स एक्सट्रैक्ट करेंगे — वेबपेज पर ये H2 नोड्स लेवल 2 हैडर के अनुरूप होते हैं। इन टाइटल्स को एक्सट्रैक्ट करने के बाद, कच्चे HTML से टेक्स्ट कंटेंट निकालने के लिए html_text() फंक्शन का उपयोग किया जाएगा.

purrr और rvest आपके लिए लोड कर दिए गए हैं, और urls वेक्टर आपके वर्कस्पेस में उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

इंटरमीडिएट फ़ंक्शनल प्रोग्रामिंग विथ purrr

पाठ्यक्रम देखें

अभ्यास निर्देश

  • html_nodes() को css = "h2" से प्रीफिल करना शुरू करें.

  • इस नए बनाए गए फंक्शन को read_html और html_text के बीच कॉम्बिन करें, ताकि H2 हैडर के लिए एक टेक्स्ट एक्सट्रैक्टर बन सके.

  • इस फंक्शन को urls वेक्टर पर चलाएँ, और परिणाम को नाम दें.

  • परिणाम प्रिंट करें ताकि आप देख सकें कि यह कैसा दिखता है.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)

# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)

# Map get_content to the urls list
res <- ___(urls, ___) %>%
  set_names(___)

# Print the results to the console
___
कोड संपादित करें और चलाएँ