Kom igångKom igång gratis

TfIdf på Twitter-data om flygbolagens sentiment

Nu ska du bygga särdrag med TfIdf-metoden och fortsätta att arbeta med datamängden tweets.

I den här övningen använder du det du lärt dig i tidigare lektioner: ta bort stoppord, använd ett tokenmönster och ange n-gram.

Slutresultatet blir en DataFrame där kolumnerna skapas med TfidfVectorizer(). En sådan DataFrame kan skickas direkt till en övervakad inlärningsmodell – vilket är vad vi tar itu med i nästa kapitel.

Den här övningen är en del av kursen

Sentimentanalys i Python

Visa kurs

Övningsinstruktioner

  • Importera det paket som krävs för att bygga en TfidfVectorizer samt ENGLISH_STOP_WORDS.
  • Bygg en TfIdf-vektoriserare från kolumnen text i datamängden tweets, där du anger uni- och bi-gram som val av n-gram, tokens som endast innehåller alfanumeriska tecken med hjälp av det givna tokenmönstret, samt stoppord motsvarande ENGLISH_STOP_WORDS.
  • Transformera vektoriseraren och ange samma kolumn som du tränade på.
  • Ange kolumnnamnen i funktionen DataFrame().

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the required vectorizer package and stop words list
____

# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)

# Transform the vectorizer
X_txt = vect.____(____.____)

# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())
Redigera och kör kod