Zacznij terazZacznij za darmo

Praca z danymi tekstowymi

W tym ćwiczeniu przeanalizujesz cytaty Sheldona Coopera z serialu Teoria Wielkiego Podrywu. To dobra okazja, żeby przekonać się, jak wygląda praca z prawdziwymi danymi tekstowymi.

Wykorzystasz mechanizm dictionary comprehension do tworzenia słowników, które mapują słowa na indeksy i odwrotnie. Słowniki sprawdzają się tu lepiej niż np. pandas.DataFrame – są bardziej intuicyjne i nie wprowadzają zbędnej złożoności.

Dane są dostępne w zmiennej sheldon_quotes, a pierwsze dwa zdania zostały już wyświetlone.

To ćwiczenie jest częścią kursu

Rekurencyjne sieci neuronowe (RNN) do modelowania języka w Keras

Zobacz kurs

Instrukcje do ćwiczenia

  • Połącz zdania w jedną zmienną metodą join, a następnie wyodrębnij wszystkie słowa i zapisz je w liście all_words.
  • Usuń duplikaty, stosując list(set()) na liście słów, i zapisz wynik w unique_words.
  • Utwórz słownik, w którym kluczami są indeksy, a wartościami słowa – użyj do tego dictionary comprehension.
  • Utwórz słownik, w którym kluczami są słowa, a wartościami indeksy – użyj do tego dictionary comprehension.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')

# Get number of unique words
unique_words = list(set(all_words))

# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}

print(index_to_word)

# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}

print(word_to_index)
Edytuj i uruchom kod