Začněte nyníZačněte zdarma

Počítání slov (I)

Jakmile máš zaznamenané informace na vyšší úrovni, můžeš začít vytvářet příznaky na základě skutečného obsahu jednotlivých textů. Jedním ze způsobů je přistupovat k tomu podobně, jako jsi pracoval/a s kategorickými proměnnými v dřívějších lekcích.

  • Pro každé jedinečné slovo v datové sadě se vytvoří sloupec.
  • Pro každý záznam se spočítá, kolikrát se dané slovo vyskytuje, a tato hodnota se zapíše do příslušného sloupce.

Tyto „počítací" sloupce pak můžeš použít k trénování modelů strojového učení.

Toto cvičení je součástí kurzu

Feature Engineering for Machine Learning in Python

Zobrazit kurz

Pokyny k cvičení

  • Importuj CountVectorizer z sklearn.feature_extraction.text.
  • Vytvoř instanci CountVectorizer a přiřaď ji do proměnné cv.
  • Natrénuj vektorizátor na sloupci text_clean.
  • Vypiš názvy příznaků, které vektorizátor vygeneroval.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import CountVectorizer
____

# Instantiate CountVectorizer
cv = ____

# Fit the vectorizer
cv.____(speech_df['text_clean'])

# Print feature names
print(cv.____)
Upravit a spustit kód