開始使用免費開始

玩玩推文,第 1 回合

還記得在本課程前幾章中,你一直在網路代理公司擔任資料分析師嗎?做得很不錯,所以現在又交給你一個新專案 ;) 在本章中,你要分析一種新的資料格式:JSON 輸出。

工程團隊提供了一份資料蒐集的輸出檔,裡面包含在 2018 年 RStudio Conf 期間收集的推文。因為這個資料集是 JSON,所以你已經在 R 中把它讀成巢狀清單。

首先,你想對這個資料集做一些基本探索,這時 purrr 就派上用場了。套件已為你載入,rstudioconf 資料集也已在你的工作空間中可用。

注意:不要嘗試印出整個資料集——它太大,無法在 DataCamp 主控台完整顯示。

請注意,這是來自 Twitter 的真實資料,因此可能含有粗話或其他冒犯性內容(本練習以及之後任何同樣使用真實 Twitter 資料的練習皆然)。

本練習屬於課程

使用 purrr 的 R 語言中級函式程式設計

檢視課程

練習說明

  • 印出清單的第一個元素,先大致了解內容與結構。

  • 因為你想聚焦在原創推文(非轉推),請利用每個子清單中的布林元素 "is_retweet",建立只包含非轉推的子清單。

  • 使用適用於整數的 map_* 變體,從這個新子清單的每個元素中擷取 "favorite_count"

  • 對前一步的結果計算中位數。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Print the first element of the list to the console 


# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")

# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")

# Get the median of favorite_count for non_rt
___(___)
編輯並執行程式碼