Tagowanie POS w spaCy
W tym ćwiczeniu przećwiczysz tagowanie POS. Tagowanie POS to przydatne narzędzie w NLP – pozwala algorytmom zrozumieć strukturę gramatyczną zdania oraz rozróżniać słowa o wielu znaczeniach, takie jak watch czy play.
Na potrzeby tego ćwiczenia model en_core_web_sm został wczytany jako nlp. W liście texts znajdziesz trzy komentarze z zestawu danych Airline Travel Information System (ATIS).
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego z użyciem spaCy
Instrukcje do ćwiczenia
- Utwórz listę
documentszawierającą kontenerydocdla każdego tekstu z listytexts, korzystając ze składni list comprehension. - Dla każdego kontenera
docwyświetl tekst tokenu oraz odpowiadający mu znacznik POS – przejdź przez listędocumentsi tokeny każdego konteneradocza pomocą zagnieżdżonej pętli for.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Compile a list of all Doc containers of texts
documents = [____(text) for text in texts]
# Print token texts and POS tags for each Doc container
for doc in documents:
for ____ in doc:
print("Text: ", ____, "| POS tag: ", ____)
print("\n")