Tokenizacja za pomocą spaCy
W tym ćwiczeniu przećwiczysz tokenizację tekstu. Skorzystasz z pierwszej recenzji z zbioru danych Amazon Fine Food Reviews. Dostęp do tej recenzji uzyskasz za pomocą dostarczonego obiektu text.
Model en_core_web_sm jest już wczytany. Możesz się do niego odwołać, wywołując nlp(). Do tworzenia list wynikowych możesz użyć wyrażeń listowych.
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego z użyciem spaCy
Instrukcje do ćwiczenia
- Zapisz kontener Doc dla wczytanej recenzji w obiekcie
document. - Zapisz teksty wszystkich tokenów z obiektu
documentw zmiennejfirst_text_tokensi wyświetl je.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a Doc container of the given text
document = ____(____)
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")