Wyszukiwanie najczęściej występujących słów
Po utworzeniu cech warto je dokładnie przejrzeć i upewnić się, że wyglądają zgodnie z oczekiwaniami. Dzięki temu można wcześnie wykryć błędy, a także zdecydować, jakie dalsze kroki inżynierii cech będą potrzebne.
Wektoryzator (cv) dopasowany w poprzednim ćwiczeniu oraz rzadka macierz z liczbą wystąpień słów (cv_trigram) są dostępne w twoim środowisku roboczym.
To ćwiczenie jest częścią kursu
Inżynieria cech w uczeniu maszynowym w Pythonie
Instrukcje do ćwiczenia
- Utwórz DataFrame zawierający cechy (liczby wystąpień słów).
- Zsumuj liczby wystąpień słów i wyświetl 5 najczęściej pojawiających się słów.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a DataFrame of the features
cv_tri_df = ____(____,
columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')
# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())