शुरू करेंमुफ़्त में शुरू करें

ट्वीट्स के साथ खेलना, राउंड 1

क्या आपको याद है कि आप इस कोर्स के पिछले चैप्टर्स में एक वेब एजेंसी में डेटा एनालिस्ट के तौर पर काम कर रहे थे? बढ़िया काम किया आपने, और अब आपको एक नया प्रोजेक्ट मिला है ;) इस चैप्टर में, आप एक नए प्रकार के डेटा का विश्लेषण करेंगे: JSON आउटपुट.

आपकी इंजीनियरिंग टीम ने आपको एक डेटा कलेक्शन का आउटपुट दिया है जिसमें RStudio Conf 2018 के दौरान इकट्ठे किए गए ट्वीट्स हैं। क्योंकि यह डेटासेट JSON में है, आपने इसे R के साथ एक nested list के रूप में पढ़ा है.

सबसे पहले, आप इस डेटासेट की बेसिक जाँच-पड़ताल करना चाहते हैं, और इसके लिए purrr मदद करेगा। पैकेज आपके लिए लोड कर दिया गया है, और rstudioconf डेटासेट आपके वर्कस्पेस में उपलब्ध है.

ध्यान दें: पूरे डेटासेट को प्रिंट करने की कोशिश न करें — यह datacamp कंसोल में प्रिंट होने के लिए बहुत बड़ा है.

यह वास्तविक Twitter डेटा है, इसलिए इसमें गाली-गलौज या अन्य आपत्तिजनक सामग्री होने का जोखिम हमेशा रहता है (इस अभ्यास में, और आगे आने वाले किसी भी अभ्यास में जो वास्तविक Twitter डेटा का उपयोग करते हैं).

यह अभ्यास पाठ्यक्रम का हिस्सा है

इंटरमीडिएट फ़ंक्शनल प्रोग्रामिंग विथ purrr

पाठ्यक्रम देखें

अभ्यास निर्देश

  • सूची (list) के पहले एलिमेंट को प्रिंट करें, ताकि कंटेंट और स्ट्रक्चर का एक ओवरव्यू मिल सके.

  • क्योंकि आप ओरिजिनल ट्वीट्स (retweets नहीं) पर फोकस करना चाहते हैं, प्रत्येक sublist में मौजूद लॉजिकल एलिमेंट "is_retweet" का उपयोग करके non-retweet की एक sublist बनाएँ.

  • इस नई sublist के प्रत्येक एलिमेंट से "favorite_count" एलिमेंट निकालें, integers के लिए उपयुक्त map_* वेरिएंट का उपयोग करते हुए.

  • पिछले परिणाम की माध्यिका निकालें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Print the first element of the list to the console 


# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")

# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")

# Get the median of favorite_count for non_rt
___(___)
कोड संपादित करें और चलाएँ