Rozpoznawanie nazwanych jednostek w spaCy
Nazwane jednostki to obiekty ze świata rzeczywistego, które mają nazwy – takie jak miasta, osoby, daty czy godziny. Możemy użyć biblioteki spaCy, aby znaleźć nazwane jednostki w transkrybowanym tekście.
W tym ćwiczeniu transkrybujesz plik call_4_channel_2.wav (plik) za pomocą funkcji transcribe_audio(), a następnie użyjesz modelu językowego spaCy – en_core_web_sm – aby przekształcić transkrybowany tekst w dokument spaCy.
Przekształcenie tekstu w dokument spaCy pozwala korzystać z wbudowanych funkcji analizy tekstu tej biblioteki: .text dla tokenów (pojedynczych słów), .sents dla zdań i .ents dla nazwanych jednostek.
To ćwiczenie jest częścią kursu
Przetwarzanie mowy w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
import spacy
# Transcribe call 4 channel 2
call_4_channel_2_text = transcribe_audio("call_4_channel_2.wav")
# Create a spaCy language model instance
nlp = spacy.load("en_core_web_sm")
# Create a spaCy doc with call 4 channel 2 text
doc = nlp(____)
# Check the type of doc
print(type(___))