ÎncepețiÎncepe gratuit

Pasul 2: Construirea unui vectorizor

În acest exercițiu, ești invitat să construiești o transformare TfIDf a coloanei review din setul de date reviews. Va trebui să specifici argumentele pentru n-grame, cuvintele de ignorat (stop words), modelul de tokenizare și dimensiunea vocabularului.

Acesta este ultimul pas înainte de a antrena un clasificator care să prezică sentimentul unei recenzii.

Asigură-te că specifici corect numărul maxim de caracteristici, deoarece un vocabular prea mare ar putea să-ți întrerupă sesiunea.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă vectorizorul Tfidf și lista implicită de cuvinte de ignorat (stop words) în engleză.
  • Construiește vectorizorul Tfidf, specificând – în această ordine – următoarele argumente: folosește ca stop words lista implicită de cuvinte de ignorat în engleză; pentru n-grame, folosește uni-grame și bi-grame; numărul maxim de caracteristici trebuie să fie 200; capturează doar cuvintele folosind modelul specificat.
  • Creează un DataFrame folosind vectorizorul Tfidf.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____

# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)

# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())
Editează și rulează codul