Bắt đầu ngayBắt đầu miễn phí

Nhận diện hồ sơ

Chúng ta vẫn đang khám phá bộ dữ liệu các tweet. Các phần tử này nằm trong một list lồng nhau gồm 5055 sublist, và chúng ta đang khám phá bằng purrr.

Trong bài tập này, bạn sẽ trả lời một câu hỏi về hành vi người dùng: có bao nhiêu người dùng chỉ retweet mà không bao giờ đăng bất kỳ "nội dung gốc" nào? Một quy tắc kinh nghiệm trên Twitter là khoảng 80% người chỉ retweet, trong khi 20% đăng nội dung, theo định luật Pareto. Chúng ta sẽ kiểm chứng điều này trong bài tập.

Để làm được, bạn sẽ cần tách bộ dữ liệu thành hai phần, rồi đếm có bao nhiêu người dùng tất cả, và có bao nhiêu người dùng chỉ nằm trong nhóm "chỉ retweet".

purrr đã được nạp sẵn cho bạn, và list rstudioconf vẫn có trong không gian làm việc của bạn.

Bài tập này là một phần của khóa học

Lập trình hàm nâng cao với purrr

Xem khóa học

Hướng dẫn bài tập

  • Tạo một sublist chỉ gồm retweet, trích xuất phần tử user_id, và loại bỏ trùng lặp bằng unique()

  • Tạo một sublist chỉ gồm tweet gốc, trích xuất phần tử user_id, và loại bỏ trùng lặp bằng unique().

  • Kết hợp union() (thuộc base R) và length() để biết tổng số người dùng.

  • Dùng hàm setdiff() (thuộc base R) để lấy những người dùng chỉ có trong sublist retweet.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Keep the RT, extract the user_id, remove the duplicate
rt <- ___(___, "is_retweet") %>%
  ___("user_id") %>% 
  ___()

# Remove the RT, extract the user id, remove the duplicate
non_rt <- ___(rstudioconf, "is_retweet") %>%
  ___("user_id") %>% 
  ___()

# Determine the total number of users
___(rt, non_rt) %>% ___()

# Determine the number of users who has just retweeted
___(rt, non_rt) %>% ___()
Chỉnh sửa và Chạy Mã