НачатьНачать бесплатно

Знакомство с текстовыми данными

В этом упражнении вы поработаете с текстовыми данными, анализируя цитаты Шелдона Купера из сериала «Теория большого взрыва». Это поможет вам понять, с какими особенностями приходится сталкиваться при работе с реальными текстовыми данными.

Вы будете использовать словарные включения для создания словарей, которые отображают слова на индексы и наоборот. Словари выбраны вместо, например, pandas.DataFrame, потому что они более интуитивны и не добавляют лишней сложности.

Данные доступны в переменной sheldon_quotes, а первые два предложения уже выведены для вас.

Это упражнение является частью курса

Рекуррентные нейронные сети (RNN) для языкового моделирования с Keras

Посмотреть курс

Инструкции к упражнению

  • С помощью join объедините предложения в одну переменную, затем извлеките все слова и сохраните этот список в all_words.
  • Удалите дублирующиеся слова, применив list(set()) к списку слов, и сохраните результат в unique_words.
  • Создайте словарь, где ключами являются индексы, а значениями — слова, используя словарные включения.
  • Создайте словарь, где ключами являются слова, а значениями — индексы, используя словарные включения.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')

# Get number of unique words
unique_words = list(set(all_words))

# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}

print(index_to_word)

# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}

print(word_to_index)
Редактировать и запускать код