BOW cu n-grame și dimensiunea vocabularului
În acest exercițiu vei exersa din nou construirea unui bag-of-words, folosind setul de date reviews cu recenzii de produse Amazon. Sarcina ta principală va fi să limitezi dimensiunea vocabularului și să specifici lungimea secvenței de tokeni.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Instrucțiuni pentru exercițiu
- Importă vectorizatorul din
sklearn. - Construiește vectorizatorul și specifică următorii parametri: dimensiunea vocabularului să fie limitată la 1.000, include doar bigrame și ignoră termenii care apar în mai mult de 500 de documente.
- Aplică vectorizatorul pe coloana
review. - Creează un DataFrame din reprezentarea BOW.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
#Import the vectorizer
from sklearn.____.____ import ____
# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)
# Transform the review
X_review = vect.transform(reviews.review)
# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())