Ordklasstaggning med spaCy
I den här övningen får du öva på ordklasstaggning (POS-taggning). POS-taggning är ett användbart verktyg inom NLP eftersom det hjälper algoritmer att förstå den grammatiska strukturen i en mening och att identifiera ord med flera betydelser, till exempel watch och play.
För den här övningen har en_core_web_sm laddats åt dig som nlp. Tre kommentarer från datamängden Airline Travel Information System (ATIS) finns tillgängliga i en lista som heter texts.
Den här övningen är en del av kursen
Naturlig språkbehandling med spaCy
Övningsinstruktioner
- Skapa
documents, en lista med alladoc-objekt för varje text i listantexts, med hjälp av listcomprehension. - Skriv ut varje tokens text och dess motsvarande POS-tagg för varje
doc-objekt genom att iterera överdocumentsoch tokenerna i varjedoc-objekt med en nästlad for-slinga.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Compile a list of all Doc containers of texts
documents = [____(text) for text in texts]
# Print token texts and POS tags for each Doc container
for doc in documents:
for ____ in doc:
print("Text: ", ____, "| POS tag: ", ____)
print("\n")