Transformowanie nowych danych
Podczas tworzenia wektorów z tekstu wszystkie przekształcenia zastosowane przed trenowaniem modelu uczenia maszynowego trzeba również zastosować na nowych, niewidzianych wcześniej danych testowych. Postępuj tak samo jak w poprzednim rozdziale: dopasuj wektoryzer tylko na danych treningowych, a następnie zastosuj go na danych testowych.
Na potrzeby tego ćwiczenia ramka danych speech_df została podzielona na dwie części:
train_speech_df: zbiór treningowy złożony z pierwszych 45 przemówień.test_speech_df: zbiór testowy złożony z pozostałych przemówień.
To ćwiczenie jest częścią kursu
Inżynieria cech w uczeniu maszynowym w Pythonie
Instrukcje do ćwiczenia
- Utwórz instancję
TfidfVectorizer. - Dopasuj wektoryzer i zastosuj go na kolumnie
text_clean. - Zastosuj ten sam wektoryzer na kolumnie
text_cleandanych testowych. - Utwórz ramkę danych z nowych cech uzyskanych ze zbioru testowego.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')
# Fit the vectroizer and transform the data
tv_transformed = ____
# Transform test data
test_tv_transformed = ____
# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____,
columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())