Tweetlerle oynamak, 1. tur
Bu kursun önceki bölümlerinde bir web ajansında veri analisti olarak çalıştığını hatırlıyor musun? Harika iş çıkardın ve şimdi sana yeni bir proje verildi ;) Bu bölümde yeni bir veri türünü analiz edeceksin: JSON çıktısı.
Mühendislik ekibin, RStudio Conf 2018 sırasında toplanan tweet'leri içeren bir veri toplama çıktısı sağladı. Bu veri kümesi JSON formatında olduğundan, R ile iç içe geçmiş bir liste olarak okudun.
Önce bu veri kümesinde temel bir keşif yapmak istiyorsun ve bunun için purrr imdadına yetişecek. Paket senin için yüklendi ve rstudioconf veri kümesi çalışma alanında hazır.
Not: tüm veri kümesini yazdırmaya çalışma — datacamp konsolunda yazdırılamayacak kadar büyük.
Bunun Twitter'dan gerçek veri olduğunu unutma; bu nedenle argo ya da başka uygunsuz içerik barındırma riski her zaman vardır (bu egzersizde ve gerçek Twitter verisi kullanılan diğer egzersizlerde).
Bu egzersiz, kursun bir parçasıdır
purrr ile Orta Düzey Fonksiyonel Programlama
Egzersiz talimatları
İçeriğe ve yapıya genel bir bakış için listenin ilk elemanını yazdır.
Odaklanmak istediğin şey özgün tweet'ler (retweet olmayanlar) olduğundan, her alt listede bulunan mantıksal
"is_retweet"öğesini kullanarak retweet olmayanlardan bir alt liste oluştur.Bu yeni alt listenin her bir elemanından
"favorite_count"öğesini, tamsayılar için uygunmap_*varyantını kullanarak çıkar.Elde ettiğin sonucun ortancasını hesapla.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Print the first element of the list to the console
# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")
# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")
# Get the median of favorite_count for non_rt
___(___)