ÎncepețiÎncepe gratuit

TfIdf aplicat pe datele de sentiment ale companiilor aeriene de pe Twitter

Vei construi acum caracteristici folosind metoda TfIdf. Vei continua să lucrezi cu setul de date tweets.

În acest exercițiu, vei aplica ce ai învățat în lecțiile anterioare: vei elimina cuvintele de stop, vei folosi un tipar de tokenizare și vei specifica n-gramele.

Rezultatul final va fi un DataFrame ale cărui coloane sunt create cu TfidfVectorizer(). Un astfel de DataFrame poate fi transmis direct unui model de învățare supervizată – exact cu asta ne vom ocupa în capitolul următor.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă pachetul necesar pentru a construi un TfidfVectorizer și ENGLISH_STOP_WORDS.
  • Construiește un vectorizator TfIdf pe baza coloanei text din setul de date tweets, specificând uni-gramele și bi-gramele ca alegere de n-grame, tokeni care conțin doar caractere alfanumerice folosind tiparul de tokenizare dat, și cuvintele de stop corespunzătoare ENGLISH_STOP_WORDS.
  • Transformă vectorizatorul, specificând aceeași coloană pe care ai antrenat modelul.
  • Specifică numele coloanelor în funcția DataFrame().

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the required vectorizer package and stop words list
____

# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)

# Transform the vectorizer
X_txt = vect.____(____.____)

# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())
Editează și rulează codul