Nhận diện hồ sơ
Chúng ta vẫn đang khám phá bộ dữ liệu các tweet. Các phần tử này nằm trong một list lồng nhau gồm 5055 sublist, và chúng ta đang khám phá bằng purrr.
Trong bài tập này, bạn sẽ trả lời một câu hỏi về hành vi người dùng: có bao nhiêu người dùng chỉ retweet mà không bao giờ đăng bất kỳ "nội dung gốc" nào? Một quy tắc kinh nghiệm trên Twitter là khoảng 80% người chỉ retweet, trong khi 20% đăng nội dung, theo định luật Pareto. Chúng ta sẽ kiểm chứng điều này trong bài tập.
Để làm được, bạn sẽ cần tách bộ dữ liệu thành hai phần, rồi đếm có bao nhiêu người dùng tất cả, và có bao nhiêu người dùng chỉ nằm trong nhóm "chỉ retweet".
purrr đã được nạp sẵn cho bạn, và list rstudioconf vẫn có trong không gian làm việc của bạn.
Bài tập này là một phần của khóa học
Lập trình hàm nâng cao với purrr
Hướng dẫn bài tập
Tạo một sublist chỉ gồm retweet, trích xuất phần tử
user_id, và loại bỏ trùng lặp bằngunique()Tạo một sublist chỉ gồm tweet gốc, trích xuất phần tử
user_id, và loại bỏ trùng lặp bằngunique().Kết hợp
union()(thuộc base R) vàlength()để biết tổng số người dùng.Dùng hàm
setdiff()(thuộc base R) để lấy những người dùng chỉ có trong sublist retweet.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Keep the RT, extract the user_id, remove the duplicate
rt <- ___(___, "is_retweet") %>%
___("user_id") %>%
___()
# Remove the RT, extract the user id, remove the duplicate
non_rt <- ___(rstudioconf, "is_retweet") %>%
___("user_id") %>%
___()
# Determine the total number of users
___(rt, non_rt) %>% ___()
# Determine the number of users who has just retweeted
___(rt, non_rt) %>% ___()