Biến đổi dữ liệu chưa từng thấy
Khi tạo vector từ văn bản, mọi biến đổi mà bạn thực hiện trước khi huấn luyện mô hình Machine Learning cũng cần được áp dụng cho dữ liệu mới (dữ liệu kiểm tra) chưa từng thấy. Để làm được điều này, hãy làm theo cách ở chương trước: chỉ fit vectorizer trên dữ liệu huấn luyện, rồi áp dụng nó lên dữ liệu kiểm tra.
Trong bài này, DataFrame speech_df đã được chia làm hai phần:
train_speech_df: Tập huấn luyện gồm 45 bài phát biểu đầu tiên.test_speech_df: Tập kiểm tra gồm các bài phát biểu còn lại.
Bài tập này là một phần của khóa học
Feature Engineering cho Machine Learning bằng Python
Hướng dẫn bài tập
- Khởi tạo
TfidfVectorizer. - Fit vectorizer và áp dụng lên cột
text_clean. - Áp dụng cùng vectorizer đó lên cột
text_cleancủa dữ liệu kiểm tra. - Tạo một DataFrame từ các đặc trưng mới này của tập kiểm tra.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')
# Fit the vectroizer and transform the data
tv_transformed = ____
# Transform test data
test_tv_transformed = ____
# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____,
columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())