Zacznij terazZacznij za darmo

Zliczanie słów (I)

Po zebraniu informacji ogólnych możesz przystąpić do tworzenia cech na podstawie rzeczywistej treści poszczególnych tekstów. Jednym ze sposobów jest podejście podobne do tego, którego użyto przy pracy ze zmiennymi kategorycznymi we wcześniejszych lekcjach.

  • Dla każdego unikalnego słowa w zbiorze danych tworzona jest osobna kolumna.
  • Dla każdego wpisu zliczana jest liczba wystąpień danego słowa, a wynik trafia do odpowiedniej kolumny.

Tak powstałe kolumny „zliczeń" można następnie wykorzystać do trenowania modeli uczenia maszynowego.

To ćwiczenie jest częścią kursu

Inżynieria cech w uczeniu maszynowym w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj CountVectorizer z sklearn.feature_extraction.text.
  • Utwórz instancję CountVectorizer i przypisz ją do zmiennej cv.
  • Dopasuj wektoryzator do kolumny text_clean.
  • Wyświetl nazwy cech wygenerowanych przez wektoryzator.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import CountVectorizer
____

# Instantiate CountVectorizer
cv = ____

# Fit the vectorizer
cv.____(speech_df['text_clean'])

# Print feature names
print(cv.____)
Edytuj i uruchom kod