Cảm xúc về hãng hàng không với stop words
Bạn được cung cấp một tập dữ liệu tên là tweets, chứa đánh giá và cảm xúc của khách hàng về các hãng hàng không. Tập dữ liệu gồm hai cột: airline_sentiment và text trong đó cảm xúc có thể là positive, negative hoặc neutral, và text là nội dung tweet.
Trong bài này, bạn sẽ tạo biểu diễn BOW nhưng có tính đến stop words. Hãy nhớ rằng stop words không giàu thông tin và bạn có thể muốn loại bỏ chúng. Việc đó sẽ làm giảm kích thước bộ từ vựng và cuối cùng là giảm số lượng đặc trưng. Lưu ý rằng bạn có thể bổ sung danh sách stop words mặc định bằng các từ phù hợp với ngữ cảnh của mình.
Bài tập này là một phần của khóa học
Phân tích cảm xúc với Python
Hướng dẫn bài tập
- Import danh sách stop words tiếng Anh mặc định.
- Cập nhật danh sách stop words mặc định với danh sách
['airline', 'airlines', '@']để tạomy_stop_words. - Chỉ định tham số stop words trong vectorizer.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____
# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])
# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)
# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())