Bắt đầu ngayBắt đầu miễn phí

Phần 1: Khám phá tập dữ liệu

Giờ bạn sẽ khám phá tập dữ liệu một chút để hình dung dữ liệu trông như thế nào. Bạn sẽ in ra một phần dữ liệu và học cách tách (tokenize) các câu trong dữ liệu thành từng từ. Với tiếng Anh, việc tokenization có vẻ đơn giản; tuy nhiên, có những ngôn ngữ như tiếng Nhật không có ranh giới từ rõ ràng và nhất quán như tiếng Anh.

Trong bài này, bạn được cung cấp hai tập dữ liệu: en_textfr_text. en_text chứa danh sách các câu tiếng Anh, còn fr_text chứa danh sách các câu tiếng Pháp tương ứng.

Bài tập này là một phần của khóa học

Machine Translation với Keras

Xem khóa học

Hướng dẫn bài tập

  • Viết một hàm zip() để lặp qua 5 câu đầu tiên của danh sách câu tiếng Anh (en_text) và câu tiếng Pháp (fr_text).
  • Lấy câu tiếng Anh đầu tiên từ en_text.
  • Tokenize câu vừa lấy bằng hàm split() với ký tự khoảng trắng và gán vào first_words.
  • In ra các từ đã được tokenize.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):  
  print("English: ", en_sent)
  print("\tFrench: ", fr_sent)

# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)
Chỉnh sửa và Chạy Mã