Kom igångKom igång gratis

Din första BOW

En bag-of-words är ett sätt att omvandla text till numerisk form.

I den här övningen tillämpar du en BOW på listan annak innan du går vidare till ett större dataset i nästa övning.

Din uppgift är att arbeta med den här listan och tillämpa en BOW med hjälp av CountVectorizer(). Den här omvandlingen är ditt första steg mot att förstå sentimentet i en text. Lägg märke till ord som kan bära ett starkt sentiment.

Kom ihåg att resultatet från en CountVectorizer() är en gles matris som bara lagrar nollskilda värden. För att se det faktiska innehållet i matrisen omvandlar vi den till en tät array med metoden .toarray().

Observera att du i det här fallet inte behöver ange argumentet max_features eftersom texten är kort.

Den här övningen är en del av kursen

Sentimentanalys i Python

Visa kurs

Övningsinstruktioner

  • Importera count vectorizer-funktionen från sklearn.feature_extraction.text.
  • Bygg och anpassa vektoriseraren på det lilla datasetet.
  • Skapa BOW-representationen med namnet anna_bow genom att anropa metoden transform().
  • Skriv ut BOW-resultatet som en tät array.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the required function
____

annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']

# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)

# Create the bow representation
anna_bow = anna_vect.____(annak)

# Print the bag-of-words result 
print(anna_bow.toarray())
Redigera och kör kod