Membiasakan diri dengan data teks
Dalam latihan ini, Anda akan bermain dengan data teks dengan menganalisis kutipan Sheldon Cooper dari serial TV The Big Bang Theory. Ini akan memberi Anda kesempatan untuk menganalisis kalimat dan mendapatkan wawasan tentang bagaimana menangani data teks dunia nyata.
Anda akan menggunakan dictionary comprehension untuk membuat kamus yang memetakan kata ke indeks dan sebaliknya. Penggunaan kamus, alih-alih misalnya pandas.DataFrame, karena lebih intuitif dan tidak menambah kompleksitas yang tidak perlu.
Data tersedia dalam sheldon_quotes dan dua kalimat pertama sudah dicetak untuk Anda.
Latihan ini merupakan bagian dari kursus
Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras
Instruksi latihan
joinseluruh kalimat menjadi satu variabel, lalu ekstrak semua katanya dan simpan daftar ini dalamall_words.- Hapus kata-kata duplikat dengan menerapkan
list(set())pada daftar kata dan simpan dalamunique_words. - Buat kamus dengan indeks sebagai key dan kata sebagai value menggunakan dictionary comprehension.
- Buat kamus dengan kata sebagai key dan indeks sebagai value menggunakan dictionary comprehension.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')
# Get number of unique words
unique_words = list(set(all_words))
# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}
print(index_to_word)
# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}
print(word_to_index)