Familiarizarea cu datele text
În acest exercițiu, vei lucra cu date text analizând citate ale lui Sheldon Cooper din serialul The Big Bang Theory. Vei avea astfel ocazia să explorezi propoziții și să înțelegi cum este să lucrezi cu date text din lumea reală.
Vei folosi expresii de tip dicționar (dictionary comprehensions) pentru a crea dicționare care mapează cuvintele la indecși și invers. Motivul pentru care se folosesc dicționare în locul unui pandas.DataFrame, de exemplu, este că sunt mai intuitive și nu adaugă complexitate inutilă.
Datele sunt disponibile în sheldon_quotes, iar primele două propoziții sunt deja afișate pentru tine.
Acest exercițiu face parte din cursul
Rețele Neuronale Recurente (RNN) pentru Modelare a Limbajului cu Keras
Instrucțiuni pentru exercițiu
- Unește propozițiile într-o singură variabilă folosind
join, extrage toate cuvintele și stochează lista înall_words. - Elimină cuvintele duplicate aplicând
list(set())pe lista de cuvinte și stochează rezultatul înunique_words. - Creează un dicționar cu indecși ca chei și cuvinte ca valori, folosind o expresie de tip dicționar (dictionary comprehension).
- Creează un dicționar cu cuvinte ca chei și indecși ca valori, folosind o expresie de tip dicționar (dictionary comprehension).
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')
# Get number of unique words
unique_words = list(set(all_words))
# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}
print(index_to_word)
# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}
print(word_to_index)