Begränsa antalet särdrag
Som du har sett skapar CountVectorizer med standardinställningar ett särdrag för varje enskilt ord i ditt korpus. Det kan resultera i alldeles för många särdrag, ofta inklusive sådana som ger mycket lite analytiskt värde.
För detta ändamål har CountVectorizer parametrar som du kan ställa in för att minska antalet särdrag:
min_df: Använd bara ord som förekommer i mer än denna andel av dokumenten. Det kan användas för att ta bort ovanliga ord som inte generaliserar väl över olika texter.max_df: Använd bara ord som förekommer i mindre än denna andel av dokumenten. Det är användbart för att eliminera mycket vanliga ord som förekommer i varje korpus utan att tillföra värde, till exempel "och" eller "the".
Den här övningen är en del av kursen
Särdragshantering för maskininlärning i Python
Övningsinstruktioner
- Begränsa antalet särdrag i CountVectorizer genom att sätta minimumet för hur många dokument ett ord måste förekomma i till 20 % och maximumet till 80 %.
- Träna och tillämpa vektoriseraren på kolumnen
text_cleani ett enda steg. - Konvertera den transformerade (glesa) matrisen till en numpy-array med räkningar.
- Skriv ut dimensionerna för den nya reducerade arrayen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import CountVectorizer
from sklearn.feature_extraction.text import CountVectorizer
# Specify arguements to limit the number of features generated
cv = ____
# Fit, transform, and convert into array
cv_transformed = ____(speech_df['text_clean'])
cv_array = ____
# Print the array shape
print(____)