Trích xuất mentions
Trong mỗi danh sách con của tập dữ liệu tweets, có một phần tử tên là "mentions_screen_name" (tức là Twitter handle). Phần tử này sẽ là NULL nếu tweet không có mention, hoặc chứa một hay nhiều screen name được nhắc đến trong tweet. Một cách để phát hiện tài khoản phổ biến từ một danh sách tweets là tìm xem những người dùng nào được nhắc đến nhiều nhất trong một bộ sưu tập tweet cụ thể.
Trước tiên, bạn sẽ trích xuất một vector gồm tất cả các mention, và khi đã có vector này, bạn sẽ đếm số lần mỗi hồ sơ được nhắc đến. Để làm điều đó, bạn sẽ xây dựng một hàm hợp thành mới, bằng cách kết hợp table() (đếm số lần xuất hiện của mỗi phần tử trong vector), sort(), và tail().
purrr đã được nạp sẵn cho bạn, và rstudioconf có trong tập dữ liệu của bạn.
Bài tập này là một phần của khóa học
Lập trình hàm nâng cao với purrr
Hướng dẫn bài tập
Xây dựng một hàm là sự kết hợp của
as_vector(),compact(), vàflatten().Tạo một hàm nhận hai đối số:
listvàwhat. Hàm này sẽ chạymap( list, what ), rồi truyền kết quả sangflatten_to_vector.Tạo
six_most, một hàm kết hợptail(),sort(), vàtable().Chạy
extractor()trênrstudioconf, và truyền kết quả chosix_most().
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Combine as_vector(), compact(), and flatten()
flatten_to_vector <- ___(___, ___, ___)
# Complete the function
extractor <- function(list, what = "mentions_screen_name"){
map( ___ , ___ ) %>%
___()
}
# Create six_most, with tail(), sort(), and table()
six_most <- ___(___, ___, ___)
# Run extractor() on rstudioconf
___(rstudioconf) %>%
___()