Kom igångKom igång gratis

Tokenisering med spaCy

I den här övningen får du träna på att tokenisera text. Du använder den första recensionen från datasetet Amazon Fine Food Reviews. Du kommer åt den via objektet text som redan finns tillgängligt.

Modellen en_core_web_sm är redan inläst. Du når den via nlp(). Du kan använda list comprehension för att bygga utdatalistor.

Den här övningen är en del av kursen

Naturlig språkbehandling med spaCy

Visa kurs

Övningsinstruktioner

  • Lagra Doc-behållaren för den förinlästa recensionen i ett objekt som heter document.
  • Lagra texterna för alla tokens i document i variabeln first_text_tokens och granska dem.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create a Doc container of the given text
document = ____(____)
    
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")
Redigera och kör kod