Zacznij terazZacznij za darmo

Rozpoznawanie encji nazwanych (NER) w spaCy

Rozpoznawanie encji nazwanych (NER) pozwala łatwo identyfikować kluczowe elementy dokumentu – takie jak imiona osób czy nazwy miejsc. Ułatwia porządkowanie nieustrukturyzowanych danych i wykrywanie ważnych informacji, co ma szczególne znaczenie przy pracy z dużymi zbiorami danych. W tym ćwiczeniu przećwiczysz rozpoznawanie encji nazwanych.

Model en_core_web_sm został załadowany jako nlp. W liście o nazwie texts znajdziesz trzy komentarze z zestawu danych Airline Travel Information System (ATIS).

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego z użyciem spaCy

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz listę documents zawierającą kontenery Doc dla każdego tekstu z listy texts – użyj do tego wyrażenia listowego (list comprehension).
  • Dla każdego kontenera doc wypisz tekst każdej encji oraz odpowiadającą jej etykietę, iterując po doc.ents.
  • Wypisz tekst szóstego tokenu oraz typ encji drugiego kontenera Doc.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Compile a list of all Doc containers of texts
documents = [____ for text in texts]

# Print the entity text and label for the entities in each document
for doc in documents:
    print([(____, ____) for ent in ____])
    
# Print the 6th token's text and entity type of the second document
print("\nText:", documents[1][5].____, "| Entity type: ", documents[1][5].____)
Edytuj i uruchom kod