Zliczanie słów (I)
Po zebraniu informacji ogólnych możesz przystąpić do tworzenia cech na podstawie rzeczywistej treści poszczególnych tekstów. Jednym ze sposobów jest podejście podobne do tego, którego użyto przy pracy ze zmiennymi kategorycznymi we wcześniejszych lekcjach.
- Dla każdego unikalnego słowa w zbiorze danych tworzona jest osobna kolumna.
- Dla każdego wpisu zliczana jest liczba wystąpień danego słowa, a wynik trafia do odpowiedniej kolumny.
Tak powstałe kolumny „zliczeń" można następnie wykorzystać do trenowania modeli uczenia maszynowego.
To ćwiczenie jest częścią kursu
Inżynieria cech w uczeniu maszynowym w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj
CountVectorizerzsklearn.feature_extraction.text. - Utwórz instancję
CountVectorizeri przypisz ją do zmiennejcv. - Dopasuj wektoryzator do kolumny
text_clean. - Wyświetl nazwy cech wygenerowanych przez wektoryzator.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import CountVectorizer
____
# Instantiate CountVectorizer
cv = ____
# Fit the vectorizer
cv.____(speech_df['text_clean'])
# Print feature names
print(cv.____)