Phần 1: Khám phá tập dữ liệu
Giờ bạn sẽ khám phá tập dữ liệu một chút để hình dung dữ liệu trông như thế nào. Bạn sẽ in ra một phần dữ liệu và học cách tách (tokenize) các câu trong dữ liệu thành từng từ. Với tiếng Anh, việc tokenization có vẻ đơn giản; tuy nhiên, có những ngôn ngữ như tiếng Nhật không có ranh giới từ rõ ràng và nhất quán như tiếng Anh.
Trong bài này, bạn được cung cấp hai tập dữ liệu: en_text và fr_text. en_text chứa danh sách các câu tiếng Anh, còn fr_text chứa danh sách các câu tiếng Pháp tương ứng.
Bài tập này là một phần của khóa học
Machine Translation với Keras
Hướng dẫn bài tập
- Viết một hàm
zip()để lặp qua 5 câu đầu tiên của danh sách câu tiếng Anh (en_text) và câu tiếng Pháp (fr_text). - Lấy câu tiếng Anh đầu tiên từ
en_text. - Tokenize câu vừa lấy bằng hàm
split()với ký tự khoảng trắng và gán vàofirst_words. - In ra các từ đã được tokenize.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):
print("English: ", en_sent)
print("\tFrench: ", fr_sent)
# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)