Kom igångKom igång gratis

Transformera osedd data

När du skapar vektorer från text behöver du applicera samma transformationer på ny, osedd (test-)data som du använde inför träningen av maskininlärningsmodellen. Följ samma tillvägagångssätt som i föregående kapitel: träna vektoriseraren enbart på träningsdata och applicera den sedan på testdata.

I den här övningen har DataFramen speech_df delats upp i två delar:

  • train_speech_df: Träningsuppsättningen bestående av de första 45 talen.
  • test_speech_df: Testuppsättningen bestående av de återstående talen.

Den här övningen är en del av kursen

Särdragshantering för maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Instantiera TfidfVectorizer.
  • Träna vektoriseraren och applicera den på kolumnen text_clean.
  • Applicera samma vektoriserare på kolumnen text_clean i testdata.
  • Skapa en DataFrame av de nya särdragen från testuppsättningen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')

# Fit the vectroizer and transform the data
tv_transformed = ____

# Transform test data
test_tv_transformed = ____

# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____, 
                          columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())
Redigera och kör kod