BOW pe recenzii de produse
Ai exersat un BOW pe un set de date mic. Acum îl vei aplica pe un eșantion de recenzii de produse Amazon. Datele au fost deja importate și se numesc reviews. Setul de date conține două coloane. Prima se numește score și are valoarea 0 când recenzia este negativă și 1 când este pozitivă. A doua coloană se numește review și conține textul recenziei scrise de client. Explorează datele în IPython Shell dacă dorești.
Sarcina ta este să construiești un vocabular BOW folosind coloana review.
Amintește-ți că poți apela metoda .get_feature_names() pe vectorizator pentru a obține lista tuturor elementelor din vocabular.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Instrucțiuni pentru exercițiu
- Creează un obiect CountVectorizer, specificând numărul maxim de caracteristici.
- Antrenează vectorizatorul.
- Aplică transformarea pe vectorizatorul antrenat.
- Creează un DataFrame în care transformi matricea rară într-un array dens și asigură-te că specifici corect numele coloanelor.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify max features
vect = ____(____=100)
# Fit the vectorizer
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df=pd.DataFrame(X_review._____, columns=___.____)
print(X_df.head())