Primul tău BOW
Bag-of-words este o abordare pentru a transforma textul în formă numerică.
În acest exercițiu, vei aplica un BOW listei annak înainte de a trece la un set de date mai mare în exercițiul următor.
Sarcina ta este să lucrezi cu această listă și să aplici un BOW folosind CountVectorizer(). Această transformare este primul tău pas în înțelegerea sentimentului dintr-un text. Acordă atenție cuvintelor care pot transmite un sentiment puternic.
Reține că rezultatul unui CountVectorizer() este o matrice rară, care stochează doar valorile nenule. Pentru a vedea conținutul efectiv al acestei matrice, o convertim într-un array dens folosind metoda .toarray().
Observă că în acest caz nu trebuie să specifici argumentul max_features, deoarece textul este scurt.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Instrucțiuni pentru exercițiu
- Importă funcția count vectorizer din
sklearn.feature_extraction.text. - Construiește și antrenează vectorizatorul pe setul de date mic.
- Creează reprezentarea BOW cu numele
anna_bowapelând metodatransform(). - Afișează rezultatul BOW ca array dens.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the required function
____
annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']
# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)
# Create the bow representation
anna_bow = anna_vect.____(annak)
# Print the bag-of-words result
print(anna_bow.toarray())