TfIdf trên dữ liệu cảm xúc hãng hàng không Twitter
Bây giờ bạn sẽ xây dựng đặc trưng bằng phương pháp TfIdf, tiếp tục làm việc với tập dữ liệu tweets.
Trong bài tập này, bạn sẽ vận dụng những gì đã học ở các bài trước: loại bỏ stop words, dùng một mẫu token và chỉ định n-grams.
Đầu ra cuối cùng sẽ là một DataFrame, trong đó các cột được tạo bằng TfidfVectorizer(). DataFrame này có thể truyền trực tiếp vào một mô hình học có giám sát, điều mà chúng ta sẽ thực hiện ở chương tiếp theo.
Bài tập này là một phần của khóa học
Phân tích cảm xúc với Python
Hướng dẫn bài tập
- Import gói cần thiết để xây dựng TfidfVectorizer và
ENGLISH_STOP_WORDS. - Xây dựng một TfIdf vectorizer từ cột
textcủa tập dữ liệutweets, chỉ định uni- và bi-grams làm lựa chọn n-grams, các token chỉ bao gồm ký tự chữ và số theo mẫu token đã cho, và stop words tương ứng vớiENGLISH_STOP_WORDS. - Biến đổi (transform) bằng vectorizer, chỉ định cùng cột mà bạn đã fit.
- Chỉ định tên cột trong hàm
DataFrame().
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the required vectorizer package and stop words list
____
# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)
# Transform the vectorizer
X_txt = vect.____(____.____)
# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())