시작하기무료로 시작하기

1단계: 데이터셋 탐색

이제 데이터셋을 간단히 살펴보겠습니다. 먼저 데이터가 어떤 모습인지 감을 잡을 거예요. 일부 데이터를 출력해 보고, 문장을 개별 단어로 토크나이즈하는 방법을 배웁니다. 영어의 경우 토크나이즈가 비교적 단순하지만, 일본어처럼 영어만큼 일관되게 구분되지 않는 언어도 있습니다.

이번 연습 문제에서는 en_textfr_text 두 개의 데이터셋이 제공됩니다. en_text에는 영어 문장 목록이, fr_text에는 해당하는 프랑스어 문장 목록이 들어 있습니다.

이 연습은 강의의 일부입니다

Keras로 배우는 Machine Translation

강의 보기

연습 안내

  • zip() 함수를 사용해 영어 문장(en_text)과 프랑스어 문장(fr_text)의 처음 5개 문장을 함께 순회하세요.
  • en_text에서 첫 번째 영어 문장을 가져오세요.
  • 가져온 문장을 공백 문자를 기준으로 split() 함수로 토크나이즈하고, 결과를 first_words에 할당하세요.
  • 토크나이즈된 단어들을 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):  
  print("English: ", en_sent)
  print("\tFrench: ", fr_sent)

# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)
코드 편집 및 실행