Bắt đầu ngayBắt đầu miễn phí

Phần 2: Khám phá bộ dữ liệu

Bây giờ bạn sẽ khám phá một số thuộc tính của bộ dữ liệu. Cụ thể, bạn sẽ xác định độ dài trung bình (tức là số lượng từ) của tất cả các câu và kích thước vốn từ vựng cho bộ dữ liệu tiếng Anh.

Trong bài này, bộ dữ liệu tiếng Anh en_text chứa danh sách các câu tiếng Anh đã được cung cấp. Bạn sẽ dùng một hàm thao tác với danh sách trong Python là <list>.extend(), một biến thể khác của hàm <list>.append(). Hãy hiểu sự khác nhau qua ví dụ: giả sử a=[1,2,3]b=[4,5]. a.append(b) sẽ cho ra danh sách [1,2,3,[4,5]], trong khi a.extend(b) sẽ cho ra [1,2,3,4,5].

Bài tập này là một phần của khóa học

Machine Translation với Keras

Xem khóa học

Hướng dẫn bài tập

  • Tính độ dài của từng câu bằng split()len() trong khi lặp qua en_text.
  • Tính độ dài trung bình của câu bằng numpy.
  • Điền danh sách all_words trong phần thân vòng lặp for bằng cách thêm tất cả các từ tìm thấy trong các câu sau khi tách từ.
  • Chuyển danh sách all_words thành một đối tượng set và tính độ dài/kích thước của set.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)

all_words = []
for sent in en_text:
  # Populate all_words with all the words in sentences
  all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)
Chỉnh sửa và Chạy Mã