Začněte nyníZačněte zdarma

Krok 2: Sestavení vektorizátoru

V tomto cvičení sestavíš TfIDf transformaci sloupce review v datasetu reviews. Budeš zadávat argumenty pro n-gramy, stop slova, vzor tokenů a velikost slovníku.

Toto je poslední krok před trénováním klasifikátoru pro predikci sentimentu recenze.

Dávej pozor na správné nastavení maximálního počtu příznaků – příliš velký slovník by mohl způsobit odpojení tvé session.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj Tfidf vektorizátor a výchozí seznam anglických stop slov.
  • Sestav Tfidf vektorizátor a zadej – v tomto pořadí – následující argumenty: jako stop slova použij výchozí seznam anglických stop slov; jako n-gramy použij uni- a bi-gramy; maximální počet příznaků nastav na 200; zachycuj pouze slova odpovídající zadanému vzoru.
  • Vytvoř DataFrame pomocí Tfidf vektorizátoru.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____

# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)

# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())
Upravit a spustit kód