Знакомство с текстовыми данными
В этом упражнении вы поработаете с текстовыми данными, анализируя цитаты Шелдона Купера из сериала «Теория большого взрыва». Это поможет вам понять, с какими особенностями приходится сталкиваться при работе с реальными текстовыми данными.
Вы будете использовать словарные включения для создания словарей, которые отображают слова на индексы и наоборот. Словари выбраны вместо, например, pandas.DataFrame, потому что они более интуитивны и не добавляют лишней сложности.
Данные доступны в переменной sheldon_quotes, а первые два предложения уже выведены для вас.
Это упражнение является частью курса
Рекуррентные нейронные сети (RNN) для языкового моделирования с Keras
Инструкции к упражнению
- С помощью
joinобъедините предложения в одну переменную, затем извлеките все слова и сохраните этот список вall_words. - Удалите дублирующиеся слова, применив
list(set())к списку слов, и сохраните результат вunique_words. - Создайте словарь, где ключами являются индексы, а значениями — слова, используя словарные включения.
- Создайте словарь, где ключами являются слова, а значениями — индексы, используя словарные включения.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')
# Get number of unique words
unique_words = list(set(all_words))
# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}
print(index_to_word)
# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}
print(word_to_index)