ÎncepețiÎncepe gratuit

Specifică lungimea secvenței de tokeni cu BOW

Am văzut în videoclip că, specificând lungimi diferite ale tokenilor – ceea ce am numit n-grame –, putem surprinde mai bine contextul, lucru care poate fi foarte important.

În acest exercițiu, vei lucra cu un eșantion din recenziile de produse Amazon. Sarcina ta este să construiești un vocabular BOW folosind coloana review și să specifici lungimea secvenței de tokeni.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Construiește vectorizatorul, specificând lungimea secvenței de tokeni ca uni- și bigrame.
  • Antrenează vectorizatorul.
  • Transformă vectorizatorul antrenat.
  • În DataFrame, asigură-te că specifici corect numele coloanelor.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())
Editează și rulează codul