Keras로 문장 토크나이즈하기
이번 연습에서는 Keras의 Tokenizer를 직접 사용해 보겠습니다. Keras Tokenizer는 몇 줄의 코드만으로 핵심적인 텍스트 전처리를 도와주는 매우 유용한 도구예요. 예를 들어, Keras Tokenizer는 단 한 번의 함수 호출로 어휘의 단어들을 ID에 자동으로 매핑해 줍니다. 여기서는 이를 좀 더 자세히 살펴보겠습니다.
Keras Tokenizer 객체를 생성하고 일부 텍스트에 대해 학습시켜서, 단어와 해당 ID로 이루어진 사전을 구축하게 할 거예요. Tokenizer를 학습시키는 데 사용하는 텍스트는 Udacity Github Repo에서 가져옵니다.
이 연습은 강의의 일부입니다
Keras로 배우는 Machine Translation
연습 안내
- Keras Tokenizer 객체를 정의하세요.
en_text에 대해 토크나이저를 학습시키세요.- 주어진 리스트
["january", "apples", "summer"]의 각 단어w에 대한 단어 ID를 가져오세요. - 단어와 해당 ID를 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
from tensorflow.keras.preprocessing.text import Tokenizer
# Define a Keras Tokenizer
en_tok = ____
# Fit the tokenizer on some text
en_tok.____(____)
for w in ["january", "apples", "summer"]:
# Get the word ID of word w
id = en_tok.____[____]
# Print the word and the word ID
print(____, " has id: ", _____)