НачатьНачать бесплатно

Анализ частоты слов

Поздравляем! Вы только что присоединились к команде PyBooks. Компания PyBooks разрабатывает систему рекомендации книг и хочет выявлять закономерности и тенденции в текстах, чтобы улучшить качество рекомендаций.

Для начала нужно разобраться, как часто встречаются слова в заданном тексте, и удалить редкие из них.

Обратите внимание: реальные наборы данных обычно значительно больше этого примера.

Это упражнение является частью курса

Глубокое обучение для работы с текстом на PyTorch

Посмотреть курс

Инструкции к упражнению

  • Импортируйте get_tokenizer из torchtext и FreqDist из библиотеки nltk.
  • Инициализируйте токенизатор для английского языка и токенизируйте заданный текст text.
  • Вычислите частотное распределение токенов tokens и удалите редкие слова с помощью списочного включения.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the necessary functions
from torchtext.data.utils import ____
from nltk.probability import ____

text = "In the city of Dataville, a data analyst named Alex explores hidden insights within vast data. With determination, Alex uncovers patterns, cleanses the data, and unlocks innovation. Join this adventure to unleash the power of data-driven decisions."

# Initialize the tokenizer and tokenize the text
tokenizer = ____("basic_english")
tokens = tokenizer(____)

threshold = 1
# Remove rare words and print common tokens
freq_dist = ____(____)
common_tokens = [token for token in tokens if ____[token] > ____]
print(common_tokens)
Редактировать и запускать код