Zacznij terazZacznij za darmo

Tokenizacja za pomocą spaCy

W tym ćwiczeniu przećwiczysz tokenizację tekstu. Skorzystasz z pierwszej recenzji z zbioru danych Amazon Fine Food Reviews. Dostęp do tej recenzji uzyskasz za pomocą dostarczonego obiektu text.

Model en_core_web_sm jest już wczytany. Możesz się do niego odwołać, wywołując nlp(). Do tworzenia list wynikowych możesz użyć wyrażeń listowych.

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego z użyciem spaCy

Zobacz kurs

Instrukcje do ćwiczenia

  • Zapisz kontener Doc dla wczytanej recenzji w obiekcie document.
  • Zapisz teksty wszystkich tokenów z obiektu document w zmiennej first_text_tokens i wyświetl je.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a Doc container of the given text
document = ____(____)
    
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")
Edytuj i uruchom kod