Začněte nyníZačněte zdarma

Transformace nových dat

Když vytváříš vektory z textu, všechny transformace provedené před trénováním modelu musíš stejným způsobem aplikovat i na nová, dosud neviděná (testovací) data. Postupuj stejně jako v předchozí kapitole: vektorizátor natrénuj pouze na trénovacích datech a na testovacích ho jen aplikuj.

Pro toto cvičení byl DataFrame speech_df rozdělen na dvě části:

  • train_speech_df: trénovací sada obsahující prvních 45 projevů.
  • test_speech_df: testovací sada obsahující zbývající projevy.

Toto cvičení je součástí kurzu

Feature Engineering for Machine Learning in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř instanci TfidfVectorizer.
  • Natrénuj vektorizátor a aplikuj ho na sloupec text_clean.
  • Stejný vektorizátor aplikuj na sloupec text_clean testovacích dat.
  • Z těchto nových příznaků testovací sady vytvoř DataFrame.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')

# Fit the vectroizer and transform the data
tv_transformed = ____

# Transform test data
test_tv_transformed = ____

# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____, 
                          columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())
Upravit a spustit kód