Aplicarea TF-IDF pe descrierile de cărți
PyBooks a colectat mai multe descrieri de cărți și dorește să identifice cuvintele importante din acestea folosind tehnica de codificare TF-IDF. Astfel, speră să obțină mai multe informații despre atributele unice ale fiecărei cărți, pentru a îmbunătăți sistemul de recomandare.
Următoarele pachete au fost importate pentru tine: torch, torchtext.
Acest exercițiu face parte din cursul
Deep Learning pentru text cu PyTorch
Instrucțiuni pentru exercițiu
- Importă clasa
TfidfVectorizerdinsklearn.feature_extraction.text, care convertește o colecție de documente brute într-o matrice de caracteristici TF-IDF. - Instanțiază un obiect al acestei clase, apoi folosește-l pentru a codifica
descriptionsîntr-o matrice TF-IDF de vectori. - Extrage și afișează primele cinci nume de caracteristici din
vectorizerși primii cinci vectori codificați dintfidf_encoded_descriptions.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)
# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])