Tvůj první BOW
Bag-of-words je přístup k převodu textu do číselné podoby.
V tomto cvičení použiješ BOW na seznam annak, než přejdeš k většímu datasetu v dalším cvičení.
Tvým úkolem bude pracovat s tímto seznamem a aplikovat BOW pomocí CountVectorizer(). Tato transformace je tvůj první krok k porozumění sentimentu textu. Věnuj pozornost slovům, která mohou nést silný sentiment.
Měj na paměti, že výstupem CountVectorizer() je řídká matice, která ukládá pouze nenulové hodnoty. Abys viděl/a skutečný obsah této matice, převeď ji na husté pole pomocí metody .toarray().
V tomto případě nemusíš zadávat argument max_features, protože text je krátký.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Importuj funkci count vectorizer z
sklearn.feature_extraction.text. - Vytvoř vektorizér a přizpůsob ho na malém datasetu.
- Vytvoř BOW reprezentaci s názvem
anna_bowzavoláním metodytransform(). - Vypiš výsledek BOW jako husté pole.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the required function
____
annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']
# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)
# Create the bow representation
anna_bow = anna_vect.____(annak)
# Print the bag-of-words result
print(anna_bow.toarray())