Praca z danymi tekstowymi
W tym ćwiczeniu przeanalizujesz cytaty Sheldona Coopera z serialu Teoria Wielkiego Podrywu. To dobra okazja, żeby przekonać się, jak wygląda praca z prawdziwymi danymi tekstowymi.
Wykorzystasz mechanizm dictionary comprehension do tworzenia słowników, które mapują słowa na indeksy i odwrotnie. Słowniki sprawdzają się tu lepiej niż np. pandas.DataFrame – są bardziej intuicyjne i nie wprowadzają zbędnej złożoności.
Dane są dostępne w zmiennej sheldon_quotes, a pierwsze dwa zdania zostały już wyświetlone.
To ćwiczenie jest częścią kursu
Rekurencyjne sieci neuronowe (RNN) do modelowania języka w Keras
Instrukcje do ćwiczenia
- Połącz zdania w jedną zmienną metodą
join, a następnie wyodrębnij wszystkie słowa i zapisz je w liścieall_words. - Usuń duplikaty, stosując
list(set())na liście słów, i zapisz wynik wunique_words. - Utwórz słownik, w którym kluczami są indeksy, a wartościami słowa – użyj do tego dictionary comprehension.
- Utwórz słownik, w którym kluczami są słowa, a wartościami indeksy – użyj do tego dictionary comprehension.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')
# Get number of unique words
unique_words = list(set(all_words))
# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}
print(index_to_word)
# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}
print(word_to_index)