Bắt đầu ngayBắt đầu miễn phí

Nhiều cột văn bản

Trong bài tập này, bạn sẽ tiếp tục làm việc với dữ liệu Twitter của hãng hàng không. Bộ dữ liệu tweets đã được nhập sẵn cho bạn.

Trong một số trường hợp, bạn có thể có nhiều hơn một cột văn bản trong bộ dữ liệu và muốn tạo biểu diễn số cho từng cột văn bản. Ở đây, ngoài cột text chứa nội dung tweet, còn có cột văn bản thứ hai tên là negativereason. Cột này chứa lý do khách hàng để lại đánh giá tiêu cực.

Nhiệm vụ của bạn là xây dựng biểu diễn BOW cho cả hai cột và chỉ định các stop words cần thiết.

Bài tập này là một phần của khóa học

Phân tích cảm xúc với Python

Xem khóa học

Hướng dẫn bài tập

  • Import gói vectorizer và danh sách stop words tiếng Anh mặc định.
  • Cập nhật danh sách stop words tiếng Anh mặc định và tạo tập my_stop_words.
  • Chỉ định đối số stop words trong vectorizer thứ nhất là tập đã cập nhật, và trong vectorizer thứ hai là tập stop words tiếng Anh mặc định.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the vectorizer and default English stop words list
____

# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
 
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____) 
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)

# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())
Chỉnh sửa và Chạy Mã