시작하기무료로 시작하기

Keras로 문장 토크나이즈하기

이번 연습에서는 Keras의 Tokenizer를 직접 사용해 보겠습니다. Keras Tokenizer는 몇 줄의 코드만으로 핵심적인 텍스트 전처리를 도와주는 매우 유용한 도구예요. 예를 들어, Keras Tokenizer는 단 한 번의 함수 호출로 어휘의 단어들을 ID에 자동으로 매핑해 줍니다. 여기서는 이를 좀 더 자세히 살펴보겠습니다.

Keras Tokenizer 객체를 생성하고 일부 텍스트에 대해 학습시켜서, 단어와 해당 ID로 이루어진 사전을 구축하게 할 거예요. Tokenizer를 학습시키는 데 사용하는 텍스트는 Udacity Github Repo에서 가져옵니다.

이 연습은 강의의 일부입니다

Keras로 배우는 Machine Translation

강의 보기

연습 안내

  • Keras Tokenizer 객체를 정의하세요.
  • en_text에 대해 토크나이저를 학습시키세요.
  • 주어진 리스트 ["january", "apples", "summer"]의 각 단어 w에 대한 단어 ID를 가져오세요.
  • 단어와 해당 ID를 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

from tensorflow.keras.preprocessing.text import Tokenizer

# Define a Keras Tokenizer
en_tok = ____

# Fit the tokenizer on some text
en_tok.____(____)

for w in ["january", "apples", "summer"]:
  # Get the word ID of word w
  id = en_tok.____[____]
  # Print the word and the word ID
  print(____, " has id: ", _____)
코드 편집 및 실행