Tìm từ khóa
Đếm các từ khóa đã biết là một trong những cách đầu tiên để bạn phân tích dữ liệu văn bản trong một bộ dữ liệu Twitter. Trong bộ dữ liệu này, bạn sẽ đếm số lần các hashtag cụ thể xuất hiện trong một tập hợp tweet về data science. Để làm việc này, bạn sẽ dùng các phương thức chuỗi trên đối tượng Series của pandas.
pandas và numpy đã được nhập lần lượt là pd và np. Một phiên bản flatten_tweets đầy đủ hơn và data_science_json cũng đã được nạp sẵn cho bạn.
Bài tập này là một phần của khóa học
Phân tích dữ liệu mạng xã hội bằng Python
Hướng dẫn bài tập
- Làm phẳng các tweet bằng
flatten_tweets()và lưu vàoflat_tweets. - Chuyển đổi tweet thành DataFrame bằng hàm khởi tạo DataFrame của pandas.
- Tìm các lần nhắc tới
#pythontrong'text', không phân biệt hoa thường. - In tỷ lệ tweet có nhắc đến
#pythonbằng cách cộngpythonvớinp.sum()và chia cho tổng số tweet.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Flatten the tweets and store them
____ = ____(____)
# Convert to DataFrame
ds_tweets = ____.____(____)
# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)
# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)