Bắt đầu ngayBắt đầu miễn phí

TfIdf trên dữ liệu cảm xúc hãng hàng không Twitter

Bây giờ bạn sẽ xây dựng đặc trưng bằng phương pháp TfIdf, tiếp tục làm việc với tập dữ liệu tweets.

Trong bài tập này, bạn sẽ vận dụng những gì đã học ở các bài trước: loại bỏ stop words, dùng một mẫu token và chỉ định n-grams.

Đầu ra cuối cùng sẽ là một DataFrame, trong đó các cột được tạo bằng TfidfVectorizer(). DataFrame này có thể truyền trực tiếp vào một mô hình học có giám sát, điều mà chúng ta sẽ thực hiện ở chương tiếp theo.

Bài tập này là một phần của khóa học

Phân tích cảm xúc với Python

Xem khóa học

Hướng dẫn bài tập

  • Import gói cần thiết để xây dựng TfidfVectorizer và ENGLISH_STOP_WORDS.
  • Xây dựng một TfIdf vectorizer từ cột text của tập dữ liệu tweets, chỉ định uni- và bi-grams làm lựa chọn n-grams, các token chỉ bao gồm ký tự chữ và số theo mẫu token đã cho, và stop words tương ứng với ENGLISH_STOP_WORDS.
  • Biến đổi (transform) bằng vectorizer, chỉ định cùng cột mà bạn đã fit.
  • Chỉ định tên cột trong hàm DataFrame().

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the required vectorizer package and stop words list
____

# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)

# Transform the vectorizer
X_txt = vect.____(____.____)

# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())
Chỉnh sửa và Chạy Mã