ÎncepețiÎncepe gratuit

Aplicarea TF-IDF pe descrierile de cărți

PyBooks a colectat mai multe descrieri de cărți și dorește să identifice cuvintele importante din acestea folosind tehnica de codificare TF-IDF. Astfel, speră să obțină mai multe informații despre atributele unice ale fiecărei cărți, pentru a îmbunătăți sistemul de recomandare.

Următoarele pachete au fost importate pentru tine: torch, torchtext.

Acest exercițiu face parte din cursul

Deep Learning pentru text cu PyTorch

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă clasa TfidfVectorizer din sklearn.feature_extraction.text, care convertește o colecție de documente brute într-o matrice de caracteristici TF-IDF.
  • Instanțiază un obiect al acestei clase, apoi folosește-l pentru a codifica descriptions într-o matrice TF-IDF de vectori.
  • Extrage și afișează primele cinci nume de caracteristici din vectorizer și primii cinci vectori codificați din tfidf_encoded_descriptions.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)

# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])
Editează și rulează codul