ÎncepețiÎncepe gratuit

Primul tău BOW

Bag-of-words este o abordare pentru a transforma textul în formă numerică.

În acest exercițiu, vei aplica un BOW listei annak înainte de a trece la un set de date mai mare în exercițiul următor.

Sarcina ta este să lucrezi cu această listă și să aplici un BOW folosind CountVectorizer(). Această transformare este primul tău pas în înțelegerea sentimentului dintr-un text. Acordă atenție cuvintelor care pot transmite un sentiment puternic.

Reține că rezultatul unui CountVectorizer() este o matrice rară, care stochează doar valorile nenule. Pentru a vedea conținutul efectiv al acestei matrice, o convertim într-un array dens folosind metoda .toarray().

Observă că în acest caz nu trebuie să specifici argumentul max_features, deoarece textul este scurt.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă funcția count vectorizer din sklearn.feature_extraction.text.
  • Construiește și antrenează vectorizatorul pe setul de date mic.
  • Creează reprezentarea BOW cu numele anna_bow apelând metoda transform().
  • Afișează rezultatul BOW ca array dens.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the required function
____

annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']

# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)

# Create the bow representation
anna_bow = anna_vect.____(annak)

# Print the bag-of-words result 
print(anna_bow.toarray())
Editează și rulează codul