TfIdf aplicat pe datele de sentiment ale companiilor aeriene de pe Twitter
Vei construi acum caracteristici folosind metoda TfIdf. Vei continua să lucrezi cu setul de date tweets.
În acest exercițiu, vei aplica ce ai învățat în lecțiile anterioare: vei elimina cuvintele de stop, vei folosi un tipar de tokenizare și vei specifica n-gramele.
Rezultatul final va fi un DataFrame ale cărui coloane sunt create cu TfidfVectorizer(). Un astfel de DataFrame poate fi transmis direct unui model de învățare supervizată – exact cu asta ne vom ocupa în capitolul următor.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Instrucțiuni pentru exercițiu
- Importă pachetul necesar pentru a construi un
TfidfVectorizerșiENGLISH_STOP_WORDS. - Construiește un vectorizator TfIdf pe baza coloanei
textdin setul de datetweets, specificând uni-gramele și bi-gramele ca alegere de n-grame, tokeni care conțin doar caractere alfanumerice folosind tiparul de tokenizare dat, și cuvintele de stop corespunzătoareENGLISH_STOP_WORDS. - Transformă vectorizatorul, specificând aceeași coloană pe care ai antrenat modelul.
- Specifică numele coloanelor în funcția
DataFrame().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the required vectorizer package and stop words list
____
# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)
# Transform the vectorizer
X_txt = vect.____(____.____)
# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())