TfIdf na datech o sentimentu leteckých společností z Twitteru
Teď si vytvoříš příznaky pomocí metody TfIdf a budeme pokračovat s datasetem tweets.
V tomto cvičení využiješ to, co ses naučil/a v předchozích lekcích: odstraníš stop slova, použiješ vzor pro tokeny a nastavíš n-gramy.
Výsledkem bude DataFrame, jehož sloupce jsou vytvořeny pomocí TfidfVectorizer(). Takový DataFrame lze přímo předat modelu pro učení s učitelem — a to bude náplní příští kapitoly.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Importuj potřebný balíček pro vytvoření
TfidfVectorizera takéENGLISH_STOP_WORDS. - Vytvoř TfIdf vektorizátor ze sloupce
textdatasetutweets: nastav uni- a bi-gramy jako volbu n-gramů, tokeny obsahující pouze alfanumerické znaky pomocí zadaného vzoru a stop slova odpovídajícíENGLISH_STOP_WORDS. - Transformuj vektorizátor a použij přitom stejný sloupec, na kterém jsi trénoval/a.
- Zadej názvy sloupců ve funkci
DataFrame().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the required vectorizer package and stop words list
____
# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)
# Transform the vectorizer
X_txt = vect.____(____.____)
# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())