TfIdf på Twitter-data om flygbolagens sentiment
Nu ska du bygga särdrag med TfIdf-metoden och fortsätta att arbeta med datamängden tweets.
I den här övningen använder du det du lärt dig i tidigare lektioner: ta bort stoppord, använd ett tokenmönster och ange n-gram.
Slutresultatet blir en DataFrame där kolumnerna skapas med TfidfVectorizer(). En sådan DataFrame kan skickas direkt till en övervakad inlärningsmodell – vilket är vad vi tar itu med i nästa kapitel.
Den här övningen är en del av kursen
Sentimentanalys i Python
Övningsinstruktioner
- Importera det paket som krävs för att bygga en TfidfVectorizer samt
ENGLISH_STOP_WORDS. - Bygg en TfIdf-vektoriserare från kolumnen
texti datamängdentweets, där du anger uni- och bi-gram som val av n-gram, tokens som endast innehåller alfanumeriska tecken med hjälp av det givna tokenmönstret, samt stoppord motsvarandeENGLISH_STOP_WORDS. - Transformera vektoriseraren och ange samma kolumn som du tränade på.
- Ange kolumnnamnen i funktionen
DataFrame().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the required vectorizer package and stop words list
____
# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)
# Transform the vectorizer
X_txt = vect.____(____.____)
# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())