Specifică lungimea secvenței de tokeni cu BOW
Am văzut în videoclip că, specificând lungimi diferite ale tokenilor – ceea ce am numit n-grame –, putem surprinde mai bine contextul, lucru care poate fi foarte important.
În acest exercițiu, vei lucra cu un eșantion din recenziile de produse Amazon. Sarcina ta este să construiești un vocabular BOW folosind coloana review și să specifici lungimea secvenței de tokeni.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Instrucțiuni pentru exercițiu
- Construiește vectorizatorul, specificând lungimea secvenței de tokeni ca uni- și bigrame.
- Antrenează vectorizatorul.
- Transformă vectorizatorul antrenat.
- În DataFrame, asigură-te că specifici corect numele coloanelor.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())