Zacznij terazZacznij za darmo

Transformowanie nowych danych

Podczas tworzenia wektorów z tekstu wszystkie przekształcenia zastosowane przed trenowaniem modelu uczenia maszynowego trzeba również zastosować na nowych, niewidzianych wcześniej danych testowych. Postępuj tak samo jak w poprzednim rozdziale: dopasuj wektoryzer tylko na danych treningowych, a następnie zastosuj go na danych testowych.

Na potrzeby tego ćwiczenia ramka danych speech_df została podzielona na dwie części:

  • train_speech_df: zbiór treningowy złożony z pierwszych 45 przemówień.
  • test_speech_df: zbiór testowy złożony z pozostałych przemówień.

To ćwiczenie jest częścią kursu

Inżynieria cech w uczeniu maszynowym w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz instancję TfidfVectorizer.
  • Dopasuj wektoryzer i zastosuj go na kolumnie text_clean.
  • Zastosuj ten sam wektoryzer na kolumnie text_clean danych testowych.
  • Utwórz ramkę danych z nowych cech uzyskanych ze zbioru testowego.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')

# Fit the vectroizer and transform the data
tv_transformed = ____

# Transform test data
test_tv_transformed = ____

# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____, 
                          columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())
Edytuj i uruchom kod