Kom igångKom igång gratis

Begränsa antalet särdrag

Som du har sett skapar CountVectorizer med standardinställningar ett särdrag för varje enskilt ord i ditt korpus. Det kan resultera i alldeles för många särdrag, ofta inklusive sådana som ger mycket lite analytiskt värde.

För detta ändamål har CountVectorizer parametrar som du kan ställa in för att minska antalet särdrag:

  • min_df : Använd bara ord som förekommer i mer än denna andel av dokumenten. Det kan användas för att ta bort ovanliga ord som inte generaliserar väl över olika texter.
  • max_df : Använd bara ord som förekommer i mindre än denna andel av dokumenten. Det är användbart för att eliminera mycket vanliga ord som förekommer i varje korpus utan att tillföra värde, till exempel "och" eller "the".

Den här övningen är en del av kursen

Särdragshantering för maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Begränsa antalet särdrag i CountVectorizer genom att sätta minimumet för hur många dokument ett ord måste förekomma i till 20 % och maximumet till 80 %.
  • Träna och tillämpa vektoriseraren på kolumnen text_clean i ett enda steg.
  • Konvertera den transformerade (glesa) matrisen till en numpy-array med räkningar.
  • Skriv ut dimensionerna för den nya reducerade arrayen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import CountVectorizer
from sklearn.feature_extraction.text import CountVectorizer

# Specify arguements to limit the number of features generated
cv = ____

# Fit, transform, and convert into array
cv_transformed = ____(speech_df['text_clean'])
cv_array = ____

# Print the array shape
print(____)
Redigera och kör kod