Kom igångKom igång gratis

Räkna ord (I)

När övergripande information har registrerats kan du börja skapa särdrag baserade på det faktiska innehållet i varje text. Ett sätt att göra detta är att använda ett liknande tillvägagångssätt som när du arbetade med kategoriska variabler i tidigare lektioner.

  • För varje unikt ord i datamängden skapas en kolumn.
  • För varje post räknas antalet gånger ordet förekommer, och det värdet lagras i respektive kolumn.

Dessa "räknar"-kolumner kan sedan användas för att träna maskininlärningsmodeller.

Den här övningen är en del av kursen

Särdragshantering för maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Importera CountVectorizer från sklearn.feature_extraction.text.
  • Instantiera CountVectorizer och tilldela den till cv.
  • Träna vektoriseraren på kolumnen text_clean.
  • Skriv ut de särdragsnamn som vektoriseraren genererar.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import CountVectorizer
____

# Instantiate CountVectorizer
cv = ____

# Fit the vectorizer
cv.____(speech_df['text_clean'])

# Print feature names
print(cv.____)
Redigera och kör kod