शुरू करेंमुफ़्त में शुरू करें

एक और extractor

पिछले अभ्यास में, हमने एक फंक्शन बनाया था जो H2 हेडर से टेक्स्ट कंटेंट निकाल सकता था.

अब कुछ अलग करें: हम किसी खास पेज पर मौजूद सभी लिंक निकालना चाहते हैं. ऐसा करने के लिए हमें httr की दो फंक्शन कॉल करने होंगी: html_nodes(), जिसमें css आर्गुमेंट "a" पर सेट होगा (a लिंक के लिए HTML टैग है), और html_attr(), जो किसी नोड से दी गई attribute निकालता है — हमारे केस में यह attribute "href" होगा, जो लिंक का पता होता है.

purrr और rvest आपके लिए लोड कर दिए गए हैं. आपके वर्कस्पेस में urls वेक्टर अब भी उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

इंटरमीडिएट फ़ंक्शनल प्रोग्रामिंग विथ purrr

पाठ्यक्रम देखें

अभ्यास निर्देश

  • html_nodes() को प्रीफिल कीजिए ताकि css आर्गुमेंट "a" पर सेट हो.

  • href() फंक्शन बनाइए, जो html_attr() का प्रीफिल्ड वर्शन होगा.

  • href(), get_a() और read_html() की नई कंपोज़िशन बनाइए.

  • इस नए फंक्शन को urls वेक्टर पर map कीजिए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create a partial version of html_nodes(), with the css param set to "a"
get_a <- ___(html_nodes, ___)

# Create href(), a partial version of html_attr()
href <- ___(___, name = "href")

# Combine href(), get_a(), and read_html()
get_links <- ___(___, ___, ___)

# Map get_links() to the urls list
res <- ___(urls, ___) %>%
  set_names(urls)

# See the result
res
कोड संपादित करें और चलाएँ