Rozpoznawanie encji nazwanych (NER) w spaCy
Rozpoznawanie encji nazwanych (NER) pozwala łatwo identyfikować kluczowe elementy dokumentu – takie jak imiona osób czy nazwy miejsc. Ułatwia porządkowanie nieustrukturyzowanych danych i wykrywanie ważnych informacji, co ma szczególne znaczenie przy pracy z dużymi zbiorami danych. W tym ćwiczeniu przećwiczysz rozpoznawanie encji nazwanych.
Model en_core_web_sm został załadowany jako nlp. W liście o nazwie texts znajdziesz trzy komentarze z zestawu danych Airline Travel Information System (ATIS).
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego z użyciem spaCy
Instrukcje do ćwiczenia
- Utwórz listę
documentszawierającą konteneryDocdla każdego tekstu z listytexts– użyj do tego wyrażenia listowego (list comprehension). - Dla każdego kontenera
docwypisz tekst każdej encji oraz odpowiadającą jej etykietę, iterując podoc.ents. - Wypisz tekst szóstego tokenu oraz typ encji drugiego kontenera
Doc.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Compile a list of all Doc containers of texts
documents = [____ for text in texts]
# Print the entity text and label for the entities in each document
for doc in documents:
print([(____, ____) for ent in ____])
# Print the 6th token's text and entity type of the second document
print("\nText:", documents[1][5].____, "| Entity type: ", documents[1][5].____)