Tìm văn bản ở những chỗ không ngờ tới
Hãy nhớ rằng nội dung liên quan không chỉ nằm trong trường text chính của tweet. Nó cũng có thể nằm trong extended_tweet, retweeted_status, hoặc quoted_status. Chúng ta cần kiểm tra tất cả các trường này để chắc chắn đã bao quát toàn bộ phần văn bản liên quan. Việc này sẽ được lặp lại thường xuyên nên chúng ta sẽ tạo một hàm để thực hiện.
Hai dòng đầu tiên kiểm tra xem trường text chính hoặc extended_tweet có chứa văn bản hay không. Bạn sẽ cần kiểm tra phần còn lại.
Bài tập này là một phần của khóa học
Phân tích dữ liệu mạng xã hội bằng Python
Hướng dẫn bài tập
Hoàn thiện hàm check_word_in_tweet bằng cách thực hiện các bước sau:
- Kiểm tra xem trường
quoted_status-textcó chứa từ đó hay không. - Kiểm tra xem trường
quoted_status-extended_tweet-full_textcó chứa từ đó hay không. - Kiểm tra xem trường
retweeted_status-textcó chứa từ đó hay không. - Kiểm tra xem trường
retweeted_status-extended_tweet-full_textcó chứa từ đó hay không.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
def check_word_in_tweet(word, data):
"""Checks if a word is in a Twitter dataset's text.
Checks text and extended tweet (140+ character tweets) for tweets,
retweets and quoted tweets.
Returns a logical pandas Series.
"""
contains_column = data['text'].str.contains(word, case = False)
contains_column |= data['extended_tweet-full_text'].str.contains(word, case = False)
contains_column |= data[____].str.contains(word, case = False)
contains_column |= data[____].____.____(____, case = False)
contains_column |= data[____].____.____(____, ____)
contains_column |= ____[____].____.____(____, ____)
return contains_column