Aplicar TF-IDF a descripciones de libros
PyBooks ha recopilado varias descripciones de libros y quiere identificar palabras importantes dentro de ellas usando la técnica de codificación TF-IDF. Con ello esperan obtener más información sobre los atributos únicos de cada libro para mejorar su sistema de recomendación.
Se han importado por ti los siguientes paquetes: torch, torchtext.
Este ejercicio forma parte del curso
Deep Learning para texto con PyTorch
Instrucciones del ejercicio
- Importa la clase
TfidfVectorizerdesklearn.feature_extraction.text, que convierte una colección de documentos en bruto en una matriz de características TF-IDF. - Crea una instancia de esta clase y usa ese objeto para codificar
descriptionsen una matriz de vectores TF-IDF. - Recupera y muestra los cinco primeros nombres de características del
vectorizery los vectores codificados detfidf_encoded_descriptions.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)
# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])