Počítání slov (I)
Jakmile máš zaznamenané informace na vyšší úrovni, můžeš začít vytvářet příznaky na základě skutečného obsahu jednotlivých textů. Jedním ze způsobů je přistupovat k tomu podobně, jako jsi pracoval/a s kategorickými proměnnými v dřívějších lekcích.
- Pro každé jedinečné slovo v datové sadě se vytvoří sloupec.
- Pro každý záznam se spočítá, kolikrát se dané slovo vyskytuje, a tato hodnota se zapíše do příslušného sloupce.
Tyto „počítací" sloupce pak můžeš použít k trénování modelů strojového učení.
Toto cvičení je součástí kurzu
Feature Engineering for Machine Learning in Python
Pokyny k cvičení
- Importuj
CountVectorizerzsklearn.feature_extraction.text. - Vytvoř instanci
CountVectorizera přiřaď ji do proměnnécv. - Natrénuj vektorizátor na sloupci
text_clean. - Vypiš názvy příznaků, které vektorizátor vygeneroval.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import CountVectorizer
____
# Instantiate CountVectorizer
cv = ____
# Fit the vectorizer
cv.____(speech_df['text_clean'])
# Print feature names
print(cv.____)