Pasul 2: Construirea unui vectorizor
În acest exercițiu, ești invitat să construiești o transformare TfIDf a coloanei review din setul de date reviews. Va trebui să specifici argumentele pentru n-grame, cuvintele de ignorat (stop words), modelul de tokenizare și dimensiunea vocabularului.
Acesta este ultimul pas înainte de a antrena un clasificator care să prezică sentimentul unei recenzii.
Asigură-te că specifici corect numărul maxim de caracteristici, deoarece un vocabular prea mare ar putea să-ți întrerupă sesiunea.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Instrucțiuni pentru exercițiu
- Importă vectorizorul Tfidf și lista implicită de cuvinte de ignorat (stop words) în engleză.
- Construiește vectorizorul Tfidf, specificând – în această ordine – următoarele argumente: folosește ca stop words lista implicită de cuvinte de ignorat în engleză; pentru n-grame, folosește uni-grame și bi-grame; numărul maxim de caracteristici trebuie să fie 200; capturează doar cuvintele folosind modelul specificat.
- Creează un DataFrame folosind vectorizorul Tfidf.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____
# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)
# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())