Bắt đầu ngayBắt đầu miễn phí

Stemming từ các tweet

Trong bài tập này, bạn sẽ làm việc với mảng tweets. Nó chứa văn bản dữ liệu cảm xúc của hãng hàng không được thu thập từ Twitter.

Nhiệm vụ của bạn là xử lý mảng này và biến nó thành một danh sách token bằng list comprehension. Sau đó, lặp qua danh sách token và tạo stem cho từng token. Hãy nhớ rằng list comprehension là cách viết một dòng thay thế cho vòng lặp for.

Bài tập này là một phần của khóa học

Phân tích cảm xúc với Python

Xem khóa học

Hướng dẫn bài tập

  • Import hàm dùng để chuyển chuỗi thành stem.
  • Gọi hàm Porter stemmer mà bạn vừa import.
  • Dùng list comprehension để tạo danh sách tokens. Danh sách này phải chứa tất cả các token từ mảng tweets.
  • Lặp qua danh sách tokens và áp dụng hàm stemming cho từng phần tử trong danh sách.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the function to perform stemming
____
from nltk import word_tokenize

# Call the stemmer
porter = ____()

# Transform the array of tweets to tokens
tokens = [____]
# Stem the list of tokens
stemmed_tokens = [[____.____(word) for word in tweet] for tweet in tokens] 
# Print the first element of the list
print(stemmed_tokens[0])
Chỉnh sửa và Chạy Mã