NER med spaCy
Namngiven entitetsigenkänning (NER) gör det enkelt att identifiera nyckelElement i ett dokument, till exempel namn på personer och platser. Det hjälper dig att sortera ostrukturerad data och hitta viktig information – vilket är avgörande när du arbetar med stora datamängder. I den här övningen tränar du på namngiven entitetsigenkänning.
en_core_web_sm har laddats åt dig som nlp. Tre kommentarer från datamängden Airline Travel Information System (ATIS) finns tillgängliga i en lista som heter texts.
Den här övningen är en del av kursen
Naturlig språkbehandling med spaCy
Övningsinstruktioner
- Skapa
documents, en lista med allaDoc-behållare för varje text itexts, med hjälp av listomfattning. - Iterera genom
doc.entsför varjedoc-behållare och skriv ut varje entitets text och tillhörande etikett. - Skriv ut den sjätte tokenens text och entitetstypen för den andra
Doc-behållaren.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Compile a list of all Doc containers of texts
documents = [____ for text in texts]
# Print the entity text and label for the entities in each document
for doc in documents:
print([(____, ____) for ent in ____])
# Print the 6th token's text and entity type of the second document
print("\nText:", documents[1][5].____, "| Entity type: ", documents[1][5].____)