Začněte nyníZačněte zdarma

TfIdf na datech o sentimentu leteckých společností z Twitteru

Teď si vytvoříš příznaky pomocí metody TfIdf a budeme pokračovat s datasetem tweets.

V tomto cvičení využiješ to, co ses naučil/a v předchozích lekcích: odstraníš stop slova, použiješ vzor pro tokeny a nastavíš n-gramy.

Výsledkem bude DataFrame, jehož sloupce jsou vytvořeny pomocí TfidfVectorizer(). Takový DataFrame lze přímo předat modelu pro učení s učitelem — a to bude náplní příští kapitoly.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj potřebný balíček pro vytvoření TfidfVectorizer a také ENGLISH_STOP_WORDS.
  • Vytvoř TfIdf vektorizátor ze sloupce text datasetu tweets: nastav uni- a bi-gramy jako volbu n-gramů, tokeny obsahující pouze alfanumerické znaky pomocí zadaného vzoru a stop slova odpovídající ENGLISH_STOP_WORDS.
  • Transformuj vektorizátor a použij přitom stejný sloupec, na kterém jsi trénoval/a.
  • Zadej názvy sloupců ve funkci DataFrame().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the required vectorizer package and stop words list
____

# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)

# Transform the vectorizer
X_txt = vect.____(____.____)

# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())
Upravit a spustit kód