ÎncepețiÎncepe gratuit

BOW cu n-grame și dimensiunea vocabularului

În acest exercițiu vei exersa din nou construirea unui bag-of-words, folosind setul de date reviews cu recenzii de produse Amazon. Sarcina ta principală va fi să limitezi dimensiunea vocabularului și să specifici lungimea secvenței de tokeni.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă vectorizatorul din sklearn.
  • Construiește vectorizatorul și specifică următorii parametri: dimensiunea vocabularului să fie limitată la 1.000, include doar bigrame și ignoră termenii care apar în mai mult de 500 de documente.
  • Aplică vectorizatorul pe coloana review.
  • Creează un DataFrame din reprezentarea BOW.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

#Import the vectorizer
from sklearn.____.____ import ____

# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)

# Transform the review
X_review = vect.transform(reviews.review)

# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())
Editează și rulează codul