EmpezarEmpieza gratis

Bolsa de palabras para títulos de libros

PyBooks ahora tiene una lista de títulos de libros que necesitan codificarse para analizarlos más a fondo. El equipo de datos cree que el modelo Bag of Words (BoW) podría ser la mejor opción.

Se han importado por ti los siguientes paquetes: torch, torchtext.

Este ejercicio forma parte del curso

Deep Learning para texto con PyTorch

Ver curso

Instrucciones del ejercicio

  • Importa la clase CountVectorizer para implementar bag-of-words.
  • Inicializa un objeto de la clase que importaste y úsalo para transformar titles en una representación matricial.
  • Extrae y muestra los primeros cinco nombres de características y los títulos codificados con el método get_feature_names_out().

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Import from sklearn
from sklearn.feature_extraction.text import ____

titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']

# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)

# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])
Editar y ejecutar código