Tokenisering med spaCy
I den här övningen får du träna på att tokenisera text. Du använder den första recensionen från datasetet Amazon Fine Food Reviews. Du kommer åt den via objektet text som redan finns tillgängligt.
Modellen en_core_web_sm är redan inläst. Du når den via nlp(). Du kan använda list comprehension för att bygga utdatalistor.
Den här övningen är en del av kursen
Naturlig språkbehandling med spaCy
Övningsinstruktioner
- Lagra Doc-behållaren för den förinlästa recensionen i ett objekt som heter
document. - Lagra texterna för alla tokens i
documenti variabelnfirst_text_tokensoch granska dem.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a Doc container of the given text
document = ____(____)
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")