Začněte nyníZačněte zdarma

Tvůj první BOW

Bag-of-words je přístup k převodu textu do číselné podoby.

V tomto cvičení použiješ BOW na seznam annak, než přejdeš k většímu datasetu v dalším cvičení.

Tvým úkolem bude pracovat s tímto seznamem a aplikovat BOW pomocí CountVectorizer(). Tato transformace je tvůj první krok k porozumění sentimentu textu. Věnuj pozornost slovům, která mohou nést silný sentiment.

Měj na paměti, že výstupem CountVectorizer() je řídká matice, která ukládá pouze nenulové hodnoty. Abys viděl/a skutečný obsah této matice, převeď ji na husté pole pomocí metody .toarray().

V tomto případě nemusíš zadávat argument max_features, protože text je krátký.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj funkci count vectorizer z sklearn.feature_extraction.text.
  • Vytvoř vektorizér a přizpůsob ho na malém datasetu.
  • Vytvoř BOW reprezentaci s názvem anna_bow zavoláním metody transform().
  • Vypiš výsledek BOW jako husté pole.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the required function
____

annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']

# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)

# Create the bow representation
anna_bow = anna_vect.____(annak)

# Print the bag-of-words result 
print(anna_bow.toarray())
Upravit a spustit kód