Krok 2: Sestavení vektorizátoru
V tomto cvičení sestavíš TfIDf transformaci sloupce review v datasetu reviews. Budeš zadávat argumenty pro n-gramy, stop slova, vzor tokenů a velikost slovníku.
Toto je poslední krok před trénováním klasifikátoru pro predikci sentimentu recenze.
Dávej pozor na správné nastavení maximálního počtu příznaků – příliš velký slovník by mohl způsobit odpojení tvé session.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Importuj Tfidf vektorizátor a výchozí seznam anglických stop slov.
- Sestav Tfidf vektorizátor a zadej – v tomto pořadí – následující argumenty: jako stop slova použij výchozí seznam anglických stop slov; jako n-gramy použij uni- a bi-gramy; maximální počet příznaků nastav na 200; zachycuj pouze slova odpovídající zadanému vzoru.
- Vytvoř DataFrame pomocí Tfidf vektorizátoru.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____
# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)
# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())