Macierz częstości słów tf-idf
W tym ćwiczeniu utworzysz macierz częstości słów tf-idf dla przykładowego zbioru dokumentów. Skorzystaj z TfidfVectorizer z biblioteki sklearn. Przekształca on listę dokumentów w macierz częstości słów, którą zwraca w formacie csr_matrix. Podobnie jak inne obiekty sklearn, posiada metody fit() i transform().
Do dyspozycji masz listę documents zawierającą przykładowe dokumenty na temat zwierząt domowych.
To ćwiczenie jest częścią kursu
Uczenie nienadzorowane w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj
TfidfVectorizerzsklearn.feature_extraction.text. - Utwórz instancję
TfidfVectorizero nazwietfidf. - Zastosuj metodę
.fit_transform()obiektutfidfdodocumentsi przypisz wynik docsr_mat. Jest to macierz częstości słów w formacie csr_matrix. - Sprawdź
csr_mat, wywołując na nim metodę.toarray()i wyświetlając wynik. Ten krok jest już wykonany. - Kolumny macierzy odpowiadają poszczególnym słowom. Pobierz listę słów, wywołując metodę
.get_feature_names_out()obiektutfidf, i przypisz wynik dowords.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import TfidfVectorizer
from ____ import ____
# Create a TfidfVectorizer: tfidf
tfidf = ____
# Apply fit_transform to document: csr_mat
csr_mat = ____
# Print result of toarray() method
print(csr_mat.toarray())
# Get the words: words
words = ____
# Print words
print(words)