Phần 2: Khám phá bộ dữ liệu
Bây giờ bạn sẽ khám phá một số thuộc tính của bộ dữ liệu. Cụ thể, bạn sẽ xác định độ dài trung bình (tức là số lượng từ) của tất cả các câu và kích thước vốn từ vựng cho bộ dữ liệu tiếng Anh.
Trong bài này, bộ dữ liệu tiếng Anh en_text chứa danh sách các câu tiếng Anh đã được cung cấp. Bạn sẽ dùng một hàm thao tác với danh sách trong Python là <list>.extend(), một biến thể khác của hàm <list>.append(). Hãy hiểu sự khác nhau qua ví dụ: giả sử a=[1,2,3] và b=[4,5]. a.append(b) sẽ cho ra danh sách [1,2,3,[4,5]], trong khi a.extend(b) sẽ cho ra [1,2,3,4,5].
Bài tập này là một phần của khóa học
Machine Translation với Keras
Hướng dẫn bài tập
- Tính độ dài của từng câu bằng
split()vàlen()trong khi lặp quaen_text. - Tính độ dài trung bình của câu bằng
numpy. - Điền danh sách
all_wordstrong phần thân vòng lặp for bằng cách thêm tất cả các từ tìm thấy trong các câu sau khi tách từ. - Chuyển danh sách
all_wordsthành một đối tượngsetvà tính độ dài/kích thước của set.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)
all_words = []
for sent in en_text:
# Populate all_words with all the words in sentences
all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)