Transformace nových dat
Když vytváříš vektory z textu, všechny transformace provedené před trénováním modelu musíš stejným způsobem aplikovat i na nová, dosud neviděná (testovací) data. Postupuj stejně jako v předchozí kapitole: vektorizátor natrénuj pouze na trénovacích datech a na testovacích ho jen aplikuj.
Pro toto cvičení byl DataFrame speech_df rozdělen na dvě části:
train_speech_df: trénovací sada obsahující prvních 45 projevů.test_speech_df: testovací sada obsahující zbývající projevy.
Toto cvičení je součástí kurzu
Feature Engineering for Machine Learning in Python
Pokyny k cvičení
- Vytvoř instanci
TfidfVectorizer. - Natrénuj vektorizátor a aplikuj ho na sloupec
text_clean. - Stejný vektorizátor aplikuj na sloupec
text_cleantestovacích dat. - Z těchto nových příznaků testovací sady vytvoř DataFrame.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')
# Fit the vectroizer and transform the data
tv_transformed = ____
# Transform test data
test_tv_transformed = ____
# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____,
columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())