ट्वीट्स के साथ खेलना, राउंड 1
क्या आपको याद है कि आप इस कोर्स के पिछले चैप्टर्स में एक वेब एजेंसी में डेटा एनालिस्ट के तौर पर काम कर रहे थे? बढ़िया काम किया आपने, और अब आपको एक नया प्रोजेक्ट मिला है ;) इस चैप्टर में, आप एक नए प्रकार के डेटा का विश्लेषण करेंगे: JSON आउटपुट.
आपकी इंजीनियरिंग टीम ने आपको एक डेटा कलेक्शन का आउटपुट दिया है जिसमें RStudio Conf 2018 के दौरान इकट्ठे किए गए ट्वीट्स हैं। क्योंकि यह डेटासेट JSON में है, आपने इसे R के साथ एक nested list के रूप में पढ़ा है.
सबसे पहले, आप इस डेटासेट की बेसिक जाँच-पड़ताल करना चाहते हैं, और इसके लिए purrr मदद करेगा। पैकेज आपके लिए लोड कर दिया गया है, और rstudioconf डेटासेट आपके वर्कस्पेस में उपलब्ध है.
ध्यान दें: पूरे डेटासेट को प्रिंट करने की कोशिश न करें — यह datacamp कंसोल में प्रिंट होने के लिए बहुत बड़ा है.
यह वास्तविक Twitter डेटा है, इसलिए इसमें गाली-गलौज या अन्य आपत्तिजनक सामग्री होने का जोखिम हमेशा रहता है (इस अभ्यास में, और आगे आने वाले किसी भी अभ्यास में जो वास्तविक Twitter डेटा का उपयोग करते हैं).
यह अभ्यास पाठ्यक्रम का हिस्सा है
इंटरमीडिएट फ़ंक्शनल प्रोग्रामिंग विथ purrr
अभ्यास निर्देश
सूची (list) के पहले एलिमेंट को प्रिंट करें, ताकि कंटेंट और स्ट्रक्चर का एक ओवरव्यू मिल सके.
क्योंकि आप ओरिजिनल ट्वीट्स (retweets नहीं) पर फोकस करना चाहते हैं, प्रत्येक sublist में मौजूद लॉजिकल एलिमेंट
"is_retweet"का उपयोग करके non-retweet की एक sublist बनाएँ.इस नई sublist के प्रत्येक एलिमेंट से
"favorite_count"एलिमेंट निकालें, integers के लिए उपयुक्तmap_*वेरिएंट का उपयोग करते हुए.पिछले परिणाम की माध्यिका निकालें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Print the first element of the list to the console
# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")
# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")
# Get the median of favorite_count for non_rt
___(___)