Zacznij terazZacznij za darmo

Rozpoznawanie nazwanych jednostek w spaCy

Nazwane jednostki to obiekty ze świata rzeczywistego, które mają nazwy – takie jak miasta, osoby, daty czy godziny. Możemy użyć biblioteki spaCy, aby znaleźć nazwane jednostki w transkrybowanym tekście.

W tym ćwiczeniu transkrybujesz plik call_4_channel_2.wav (plik) za pomocą funkcji transcribe_audio(), a następnie użyjesz modelu językowego spaCyen_core_web_sm – aby przekształcić transkrybowany tekst w dokument spaCy.

Przekształcenie tekstu w dokument spaCy pozwala korzystać z wbudowanych funkcji analizy tekstu tej biblioteki: .text dla tokenów (pojedynczych słów), .sents dla zdań i .ents dla nazwanych jednostek.

To ćwiczenie jest częścią kursu

Przetwarzanie mowy w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

import spacy

# Transcribe call 4 channel 2
call_4_channel_2_text = transcribe_audio("call_4_channel_2.wav")

# Create a spaCy language model instance
nlp = spacy.load("en_core_web_sm")

# Create a spaCy doc with call 4 channel 2 text
doc = nlp(____)

# Check the type of doc
print(type(___))
Edytuj i uruchom kod