Räkna ord (I)
När övergripande information har registrerats kan du börja skapa särdrag baserade på det faktiska innehållet i varje text. Ett sätt att göra detta är att använda ett liknande tillvägagångssätt som när du arbetade med kategoriska variabler i tidigare lektioner.
- För varje unikt ord i datamängden skapas en kolumn.
- För varje post räknas antalet gånger ordet förekommer, och det värdet lagras i respektive kolumn.
Dessa "räknar"-kolumner kan sedan användas för att träna maskininlärningsmodeller.
Den här övningen är en del av kursen
Särdragshantering för maskininlärning i Python
Övningsinstruktioner
- Importera
CountVectorizerfrånsklearn.feature_extraction.text. - Instantiera
CountVectorizeroch tilldela den tillcv. - Träna vektoriseraren på kolumnen
text_clean. - Skriv ut de särdragsnamn som vektoriseraren genererar.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import CountVectorizer
____
# Instantiate CountVectorizer
cv = ____
# Fit the vectorizer
cv.____(speech_df['text_clean'])
# Print feature names
print(cv.____)