Transformera osedd data
När du skapar vektorer från text behöver du applicera samma transformationer på ny, osedd (test-)data som du använde inför träningen av maskininlärningsmodellen. Följ samma tillvägagångssätt som i föregående kapitel: träna vektoriseraren enbart på träningsdata och applicera den sedan på testdata.
I den här övningen har DataFramen speech_df delats upp i två delar:
train_speech_df: Träningsuppsättningen bestående av de första 45 talen.test_speech_df: Testuppsättningen bestående av de återstående talen.
Den här övningen är en del av kursen
Särdragshantering för maskininlärning i Python
Övningsinstruktioner
- Instantiera
TfidfVectorizer. - Träna vektoriseraren och applicera den på kolumnen
text_clean. - Applicera samma vektoriserare på kolumnen
text_cleani testdata. - Skapa en DataFrame av de nya särdragen från testuppsättningen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')
# Fit the vectroizer and transform the data
tv_transformed = ____
# Transform test data
test_tv_transformed = ____
# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____,
columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())