Bắt đầu ngayBắt đầu miễn phí

Tìm từ khóa

Đếm các từ khóa đã biết là một trong những cách đầu tiên để bạn phân tích dữ liệu văn bản trong một bộ dữ liệu Twitter. Trong bộ dữ liệu này, bạn sẽ đếm số lần các hashtag cụ thể xuất hiện trong một tập hợp tweet về data science. Để làm việc này, bạn sẽ dùng các phương thức chuỗi trên đối tượng Series của pandas.

pandasnumpy đã được nhập lần lượt là pdnp. Một phiên bản flatten_tweets đầy đủ hơn và data_science_json cũng đã được nạp sẵn cho bạn.

Bài tập này là một phần của khóa học

Phân tích dữ liệu mạng xã hội bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Làm phẳng các tweet bằng flatten_tweets() và lưu vào flat_tweets.
  • Chuyển đổi tweet thành DataFrame bằng hàm khởi tạo DataFrame của pandas.
  • Tìm các lần nhắc tới #python trong 'text', không phân biệt hoa thường.
  • In tỷ lệ tweet có nhắc đến #python bằng cách cộng python với np.sum() và chia cho tổng số tweet.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Flatten the tweets and store them
____ = ____(____)

# Convert to DataFrame
ds_tweets = ____.____(____)

# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)

# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)
Chỉnh sửa và Chạy Mã