ÎncepețiÎncepe gratuit

BOW pe recenzii de produse

Ai exersat un BOW pe un set de date mic. Acum îl vei aplica pe un eșantion de recenzii de produse Amazon. Datele au fost deja importate și se numesc reviews. Setul de date conține două coloane. Prima se numește score și are valoarea 0 când recenzia este negativă și 1 când este pozitivă. A doua coloană se numește review și conține textul recenziei scrise de client. Explorează datele în IPython Shell dacă dorești.

Sarcina ta este să construiești un vocabular BOW folosind coloana review.

Amintește-ți că poți apela metoda .get_feature_names() pe vectorizator pentru a obține lista tuturor elementelor din vocabular.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un obiect CountVectorizer, specificând numărul maxim de caracteristici.
  • Antrenează vectorizatorul.
  • Aplică transformarea pe vectorizatorul antrenat.
  • Creează un DataFrame în care transformi matricea rară într-un array dens și asigură-te că specifici corect numele coloanelor.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify max features 
vect = ____(____=100)
# Fit the vectorizer
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df=pd.DataFrame(X_review._____, columns=___.____)
print(X_df.head())
Editează și rulează codul