Chơi với tweets, vòng 1
Bạn còn nhớ trong các chương trước bạn làm nhà phân tích dữ liệu cho một web agency chứ? Bạn làm rất tốt nên giờ bạn được giao thêm một dự án ;) Ở chương này, bạn sẽ phân tích một kiểu dữ liệu mới: đầu ra JSON.
Đội kỹ sư đã đưa cho bạn kết quả thu thập dữ liệu gồm các tweet được gom trong thời gian RStudio Conf 2018. Vì bộ dữ liệu này ở định dạng JSON, bạn đã đọc nó thành một list lồng nhau trong R.
Đầu tiên, bạn muốn khám phá sơ bộ bộ dữ liệu này, và purrr sẽ hỗ trợ bạn. Gói đã được nạp sẵn, và bộ dữ liệu rstudioconf có sẵn trong workspace của bạn.
Lưu ý: đừng cố in toàn bộ bộ dữ liệu — nó quá lớn để in ra trong console của datacamp.
Hãy lưu ý đây là dữ liệu thật từ Twitter nên luôn có khả năng chứa ngôn từ thô tục hoặc nội dung gây xúc phạm (trong bài tập này và các bài sau cũng dùng dữ liệu Twitter thật).
Bài tập này là một phần của khóa học
Lập trình hàm nâng cao với purrr
Hướng dẫn bài tập
In phần tử đầu tiên của list để có cái nhìn tổng quan về nội dung và cấu trúc.
Vì bạn muốn tập trung vào các tweet nguyên bản (không phải retweet), hãy tạo một sublist gồm các mục không phải retweet bằng cách dùng phần tử logic
"is_retweet"có trong mỗi sublist.Trích xuất phần tử
"favorite_count"của mỗi phần tử trong sublist mới này bằng biến thểmap_*dành cho số nguyên.Tính median của kết quả ở bước trước.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Print the first element of the list to the console
# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")
# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")
# Get the median of favorite_count for non_rt
___(___)