Zacznij terazZacznij za darmo

Wyszukiwanie najczęściej występujących słów

Po utworzeniu cech warto je dokładnie przejrzeć i upewnić się, że wyglądają zgodnie z oczekiwaniami. Dzięki temu można wcześnie wykryć błędy, a także zdecydować, jakie dalsze kroki inżynierii cech będą potrzebne.

Wektoryzator (cv) dopasowany w poprzednim ćwiczeniu oraz rzadka macierz z liczbą wystąpień słów (cv_trigram) są dostępne w twoim środowisku roboczym.

To ćwiczenie jest częścią kursu

Inżynieria cech w uczeniu maszynowym w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz DataFrame zawierający cechy (liczby wystąpień słów).
  • Zsumuj liczby wystąpień słów i wyświetl 5 najczęściej pojawiających się słów.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a DataFrame of the features
cv_tri_df = ____(____, 
                 columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')

# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())
Edytuj i uruchom kod