Звикаємо до текстових даних
У цій вправі ви попрацюєте з текстовими даними, аналізуючи цитати Шелдона Купера з серіалу The Big Bang Theory. Це дасть змогу розібрати речення та відчути, що означає працювати з реальними текстовими даними.
Ви використаєте словникові включення, щоб створити словники, які відображають слова в індекси й навпаки. Ми використовуємо саме словники, а не, наприклад, pandas.DataFrame, тому що вони інтуїтивніші й не додають зайвої складності.
Дані доступні в sheldon_quotes, перші два речення вже виведено для вас.
Ця вправа є частиною курсу
Recurrent Neural Networks (RNNs) для моделювання мови з Keras
Інструкції до вправи
joinоб'єднайте речення в одну змінну, потім видобудьте всі слова та збережіть цей список уall_words.- Приберіть повторювані слова, застосувавши
list(set())до списку слів, і збережіть їх уunique_words. - Створіть словник з індексами як ключами та словами як значеннями за допомогою словникових включень.
- Створіть словник зі словами як ключами та індексами як значеннями за допомогою словникових включень.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')
# Get number of unique words
unique_words = list(set(all_words))
# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}
print(index_to_word)
# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}
print(word_to_index)