Abgleichen mit erweiterter Syntax in spaCy

Regelbasierte Informationsextraktion ist ein zentraler Bestandteil jeder NLP-Pipeline. Die Klasse Matcher macht Muster (Patterns) ausdrucksstärker, indem sie Operatoren in geschweiften Klammern erlaubt. Diese Operatoren dienen erweiterten Vergleichen und ähneln Python-Operatoren wie in, not in sowie Vergleichsoperatoren. In dieser Übung arbeitest du mit der Matching-Funktionalität von spaCy, dem Matcher, um Treffer für vorgegebene Begriffe in einem Beispieltext zu finden.

Die Klasse Matcher ist bereits aus der Bibliothek spacy.matcher importiert. In dieser Übung verwendest du einen Doc-Container mit Beispieltext, erreichbar über doc. Ein vorab geladenes spaCy-Modell ist außerdem unter nlp verfügbar.

Diese Übung ist Teil des Kurses

<Kurs>Natural Language Processing mit spaCy</Kurs>

Übungsanweisungen

Definiere ein Matcher-Objekt mit Matcher und nlp.
Verwende den Operator IN, um ein Pattern zu definieren, das tiny squares und tiny mouthful abgleicht.
Verwende dieses Pattern, um Treffer in doc zu finden.
Gib Start- und End-Token-Indizes sowie die Textspanne der Treffer aus.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

nlp = spacy.load("en_core_web_sm")
doc = nlp(example_text)

# Define a matcher object
matcher = Matcher(nlp.____)
# Define a pattern to match tiny squares and tiny mouthful
pattern = [{"lower": ____}, {"lower": {____: ["squares", "mouthful"]}}]

# Add the pattern to matcher object and find matches
matcher.____("CustomMatcher", [____])
matches = ____(____)

# Print out start and end token indices and the matched text span per match
for match_id, start, end in matches:
    print("Start token: ", ____, " | End token: ", ____, "| Matched text: ", doc[____:____].text)

Code bearbeiten und ausführen

Diese Übung ist Teil des Kurses

<Kurs>Natural Language Processing mit spaCy</Kurs>

Mittlere SchwierigkeitSchwierigkeitsgrad

4.8+

Kurs kostenlos starten

In diesem Kapitel lernst du NLP kennen, inklusive einiger Anwendungsfälle wie die Erkennung benannter Entitäten und KI-gestützte Chatbots. Du erfährst, wie du die leistungsstarke Bibliothek spaCy für verschiedene Aufgaben der Sprachverarbeitung einsetzt, zum Beispiel Tokenisierung, Satzsegmentierung, POS-Tagging und Erkennung benannter Entitäten.

Exercise 1: Grundlagen der Natural Language Processing (NLP)Exercise 2: Doc-Container in spaCy Exercise 3: Anwendungsfall für NER Exercise 4: Tokenisierung mit spaCy Exercise 5: spaCy-Grundlagen Exercise 6: Eine spaCy-Pipeline ausführen Exercise 7: Lemmatisierung mit spaCy Exercise 8: Satzsegmentierung mit spaCy Exercise 9: Linguistische Merkmale in spaCy Exercise 10: POS-Tagging mit spaCy Exercise 11: NER mit spaCy Exercise 12: Textverarbeitung mit spaCy

Lerne sprachliche Merkmale, Wortvektoren, semantische Ähnlichkeit, Analogien und Operationen mit Wortvektoren kennen. In diesem Kapitel entdeckst du, wie du mit spaCy Wortvektoren extrahierst, Texte zu einem bestimmten Thema kategorisierst und semantisch ähnliche Begriffe zu gegebenen Wörtern aus einem Korpus oder aus dem Vokabular eines spaCy-Modells findest.

Exercise 1: Linguistische Merkmale Exercise 2: Linguistische Annotationen in spaCy Exercise 3: Wortsinndisambiguierung mit spaCy Exercise 4: Dependency Parsing mit spaCy Exercise 5: Einführung in Wortvektoren Exercise 6: spaCy-Vokabular Exercise 7: Wortvektoren im spaCy-Vokabular Exercise 8: Wortvektoren und spaCy Exercise 9: Analogien und Vektoroperationen Exercise 10: Projektion von Wortvektoren Exercise 11: Ähnliche Wörter in einem Vokabular Exercise 12: Semantische Ähnlichkeit mit spaCy messen Exercise 13: Doc-Ähnlichkeit mit spaCy Exercise 14: Span-Ähnlichkeit mit spaCy Exercise 15: Semantische Ähnlichkeit zur Kategorisierung von Text

Mach dich mit spaCy-Pipeline-Komponenten vertraut, lerne, wie du eine Pipeline-Komponente hinzufügst, und analysiere die NLP-Pipeline. Außerdem lernst du mehrere Ansätze für regelbasierte Informationsextraktion kennen, mit den Klassen EntityRuler, Matcher und PhraseMatcher in spaCy sowie dem Python-Paket RegEx.

Exercise 1: spaCy-Pipelines Exercise 2: Pipes in spaCy hinzufügen Exercise 3: Pipelines in spaCy analysieren Exercise 4: spaCy EntityRuler Exercise 5: EntityRuler mit leerem spaCy-Modell Exercise 6: EntityRuler für NER Exercise 7: EntityRuler mit mehreren Mustern in spaCy Exercise 8: RegEx mit spaCy Exercise 9: RegEx in Python Exercise 10: RegEx mit EntityRuler in spaCy Exercise 11: spaCy Matcher und PhraseMatcher Exercise 12: Einen einzelnen Begriff in spaCy matchen Exercise 13: PhraseMatcher in spaCy Exercise 14: Abgleichen mit erweiterter Syntax in spaCy

Aktuelle Übung

Erkunde mehrere praxisnahe Anwendungsfälle, in denen spaCy-Modelle versagen können, und lerne, wie du sie weitertrainierst, um die Modellleistung zu verbessern. Du wirst in die Trainingsschritte von spaCy eingeführt und verstehst, wie du ein vorhandenes spaCy-Modell oder eines von Grund auf trainierst und das Modell zur Inferenzzeit evaluierst.

Exercise 1: spaCy-Modelle anpassen Exercise 2: spaCy-Modelle trainieren Exercise 3: Modellleistung auf deinen Daten Exercise 4: spaCy-Trainingsdatenformat Exercise 5: Trainingsschritte Exercise 6: Annotation und Vorbereitung von Trainingsdaten Exercise 7: Kompatible Trainingsdaten Exercise 8: Training mit spaCy Exercise 9: Schritte zur Trainingsvorbereitung Exercise 10: Ein vorhandenes NER-Modell trainieren Exercise 11: Ein spaCy-Modell von Grund auf trainieren Exercise 12: Abschluss