Tokenizare cu spaCy
În acest exercițiu, vei exersa tokenizarea textelor. Vei folosi prima recenzie din setul de date Amazon Fine Food Reviews. Poți accesa această recenzie prin obiectul text furnizat.
Modelul en_core_web_sm este deja încărcat. Îl poți apela folosind nlp(). Poți utiliza list comprehension pentru a construi listele de rezultate.
Acest exercițiu face parte din cursul
Procesarea limbajului natural cu spaCy
Instrucțiuni pentru exercițiu
- Stochează containerul Doc pentru recenzia preîncărcată într-un obiect numit
document. - Stochează textele tuturor token-urilor din
documentîn variabilafirst_text_tokensși verifică-le.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a Doc container of the given text
document = ____(____)
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")