EmpezarEmpieza gratis

Aplicar TF-IDF a descripciones de libros

PyBooks ha recopilado varias descripciones de libros y quiere identificar palabras importantes dentro de ellas usando la técnica de codificación TF-IDF. Con ello esperan obtener más información sobre los atributos únicos de cada libro para mejorar su sistema de recomendación.

Se han importado por ti los siguientes paquetes: torch, torchtext.

Este ejercicio forma parte del curso

Deep Learning para texto con PyTorch

Ver curso

Instrucciones del ejercicio

  • Importa la clase TfidfVectorizer de sklearn.feature_extraction.text, que convierte una colección de documentos en bruto en una matriz de características TF-IDF.
  • Crea una instancia de esta clase y usa ese objeto para codificar descriptions en una matriz de vectores TF-IDF.
  • Recupera y muestra los cinco primeros nombres de características del vectorizer y los vectores codificados de tfidf_encoded_descriptions.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)

# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])
Editar y ejecutar código