Stosowanie TF-IDF do opisów książek
Firma PyBooks zebrała opisy kilku książek i chce zidentyfikować w nich ważne słowa za pomocą techniki kodowania TF-IDF. Dzięki temu ma nadzieję lepiej poznać unikalne cechy każdej książki i usprawnić swój system rekomendacji.
Następujące pakiety zostały już zaimportowane: torch, torchtext.
To ćwiczenie jest częścią kursu
Uczenie głębokie dla tekstu z PyTorch
Instrukcje do ćwiczenia
- Zaimportuj klasę
TfidfVectorizerz modułusklearn.feature_extraction.text– przekształca ona zbiór surowych dokumentów na macierz cech TF-IDF. - Utwórz instancję tej klasy, a następnie użyj jej do zakodowania zmiennej
descriptionsw macierz wektorów TF-IDF. - Pobierz i wyświetl pierwsze pięć nazw cech z obiektu
vectorizeroraz pierwsze pięć zakodowanych wektorów ztfidf_encoded_descriptions.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)
# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])