EmpezarEmpieza gratis

Análisis de frecuencia de palabras

¡Enhorabuena! Acabas de unirte a PyBooks. PyBooks está desarrollando un sistema de recomendación de libros y quiere encontrar patrones y tendencias en texto para mejorar sus recomendaciones.

Para empezar, querrás entender la frecuencia de las palabras en un texto dado y eliminar las palabras poco frecuentes.

Ten en cuenta que los conjuntos de datos reales típicos serán más grandes que este ejemplo.

Este ejercicio forma parte del curso

Deep Learning para texto con PyTorch

Ver curso

Instrucciones del ejercicio

  • Importa get_tokenizer de torchtext y FreqDist de la biblioteca nltk.
  • Inicializa el tokenizador para inglés y tokeniza el text dado.
  • Calcula la distribución de frecuencias de los tokens y elimina las palabras raras usando una list comprehension.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Import the necessary functions
from torchtext.data.utils import ____
from nltk.probability import ____

text = "In the city of Dataville, a data analyst named Alex explores hidden insights within vast data. With determination, Alex uncovers patterns, cleanses the data, and unlocks innovation. Join this adventure to unleash the power of data-driven decisions."

# Initialize the tokenizer and tokenize the text
tokenizer = ____("basic_english")
tokens = tokenizer(____)

threshold = 1
# Remove rare words and print common tokens
freq_dist = ____(____)
common_tokens = [token for token in tokens if ____[token] > ____]
print(common_tokens)
Editar y ejecutar código