Začněte nyníZačněte zdarma

Tfidf a BOW na stejných datech

V tomto cvičení transformuješ sloupec review z Amazon produktových reviews pomocí bag-of-words i tfidf transformace.

Sestavíš oba vektorizátory – u každého nastav maximální počet příznaků na 100. Po transformaci vytvoř DataFramy a vypiš prvních 5 řádků každého z nich.

Dej pozor na správné nastavení maximálního počtu příznaků ve slovníku. Příliš velká slovní zásoba může způsobit odpojení session.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj vektorizátory BOW a Tfidf.
  • Sestav a natrénuj BOW a Tfidf vektorizátor na sloupci review a omez počet vytvořených příznaků na 100.
  • Z transformovaných vektorových reprezentací vytvoř DataFramy.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the required packages
____

# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____) 

# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers 
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())
Upravit a spustit kód