Kom igångKom igång gratis

Steg 2: Bygg en vektoriserare

I den här övningen ska du bygga en TF-IDF-transformation av kolumnen review i datamängden reviews. Du anger n-gram, stoppord, tokenmönster och vokabulärstorlek som argument.

Detta är det sista steget innan vi tränar en klassificerare för att förutsäga sentimentet i en recension.

Se till att ange det maximala antalet särdrag korrekt – en alltför stor vokabulär kan koppla ned din session.

Den här övningen är en del av kursen

Sentimentanalys i Python

Visa kurs

Övningsinstruktioner

  • Importera TF-IDF-vektoriseraren och standardlistan med engelska stoppord.
  • Bygg TF-IDF-vektoriseraren och ange följande argument i den här ordningen: använd standardlistan med engelska stoppord som stoppord; använd uni- och bigrammar som n-gram; det maximala antalet särdrag ska vara 200; fånga endast ord med det angivna mönstret.
  • Skapa en DataFrame med hjälp av TF-IDF-vektoriseraren.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____

# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)

# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())
Redigera och kör kod