ÎncepețiÎncepe gratuit

Familiarizarea cu datele text

În acest exercițiu, vei lucra cu date text analizând citate ale lui Sheldon Cooper din serialul The Big Bang Theory. Vei avea astfel ocazia să explorezi propoziții și să înțelegi cum este să lucrezi cu date text din lumea reală.

Vei folosi expresii de tip dicționar (dictionary comprehensions) pentru a crea dicționare care mapează cuvintele la indecși și invers. Motivul pentru care se folosesc dicționare în locul unui pandas.DataFrame, de exemplu, este că sunt mai intuitive și nu adaugă complexitate inutilă.

Datele sunt disponibile în sheldon_quotes, iar primele două propoziții sunt deja afișate pentru tine.

Acest exercițiu face parte din cursul

Rețele Neuronale Recurente (RNN) pentru Modelare a Limbajului cu Keras

Vezi cursul

Instrucțiuni pentru exercițiu

  • Unește propozițiile într-o singură variabilă folosind join, extrage toate cuvintele și stochează lista în all_words.
  • Elimină cuvintele duplicate aplicând list(set()) pe lista de cuvinte și stochează rezultatul în unique_words.
  • Creează un dicționar cu indecși ca chei și cuvinte ca valori, folosind o expresie de tip dicționar (dictionary comprehension).
  • Creează un dicționar cu cuvinte ca chei și indecși ca valori, folosind o expresie de tip dicționar (dictionary comprehension).

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')

# Get number of unique words
unique_words = list(set(all_words))

# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}

print(index_to_word)

# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}

print(word_to_index)
Editează și rulează codul