Doc-Ähnlichkeit mit spaCy

Semantische Ähnlichkeit bedeutet, mehrere Sätze zu analysieren, um Gemeinsamkeiten zwischen ihnen zu erkennen. In dieser Übung berechnest du die semantische Ähnlichkeit von Dokumenten mit einem gegebenen Dokument. Das Ziel ist, eine Liste von Bewertungen zu kategorisieren, die für Dosenhundefutter relevant sind.

Die Kategorie Dosenhundefutter ist in category gespeichert. Eine Stichprobe von fünf Lebensmittelbewertungen findest du in der Liste texts. en_core_web_md ist als nlp geladen.

Diese Übung ist Teil des Kurses

Natural Language Processing mit spaCy

Anleitung zur Übung

Erstelle eine Liste documents, die Doc-Container aller texts enthält.
Erstelle einen Doc-Container aus category und speichere ihn als category_document.
Iteriere über documents und gib die Ähnlichkeitswerte jedes Doc-Containers mit dem category_document aus, auf drei Nachkommastellen gerundet.

Interaktive Übung

Vervollständige den Beispielcode, um diese Übung erfolgreich abzuschließen.

# Create a documents list containing Doc containers
documents = [____ for t in texts]

# Create a Doc container of the category
category = "canned dog food"
category_document = ____(____)

# Print similarity scores of each Doc container and the category_document
for i, doc in enumerate(documents):
  print(f"Semantic similarity with document {i+1}:", round(doc.____(____), 3))

Code bearbeiten und ausführen

Diese Übung ist Teil des Kurses

Natural Language Processing mit spaCy

Mittlere SchwierigkeitSchwierigkeitsgrad

4.8+

Kurs kostenlos starten

In diesem Kapitel lernst du NLP kennen, inklusive einiger Anwendungsfälle wie die Erkennung benannter Entitäten und KI-gestützte Chatbots. Du erfährst, wie du die leistungsstarke Bibliothek spaCy für verschiedene Aufgaben der Sprachverarbeitung einsetzt, zum Beispiel Tokenisierung, Satzsegmentierung, POS-Tagging und Erkennung benannter Entitäten.

Exercise 1: Grundlagen der Natural Language Processing (NLP)Exercise 2: Doc-Container in spaCy Exercise 3: Anwendungsfall für NER Exercise 4: Tokenisierung mit spaCy Exercise 5: spaCy-Grundlagen Exercise 6: Eine spaCy-Pipeline ausführen Exercise 7: Lemmatisierung mit spaCy Exercise 8: Satzsegmentierung mit spaCy Exercise 9: Linguistische Merkmale in spaCy Exercise 10: POS-Tagging mit spaCy Exercise 11: NER mit spaCy Exercise 12: Textverarbeitung mit spaCy

Lerne sprachliche Merkmale, Wortvektoren, semantische Ähnlichkeit, Analogien und Operationen mit Wortvektoren kennen. In diesem Kapitel entdeckst du, wie du mit spaCy Wortvektoren extrahierst, Texte zu einem bestimmten Thema kategorisierst und semantisch ähnliche Begriffe zu gegebenen Wörtern aus einem Korpus oder aus dem Vokabular eines spaCy-Modells findest.

Exercise 1: Linguistische Merkmale Exercise 2: Linguistische Annotationen in spaCy Exercise 3: Wortsinndisambiguierung mit spaCy Exercise 4: Dependency Parsing mit spaCy Exercise 5: Einführung in Wortvektoren Exercise 6: spaCy-Vokabular Exercise 7: Wortvektoren im spaCy-Vokabular Exercise 8: Wortvektoren und spaCy Exercise 9: Analogien und Vektoroperationen Exercise 10: Projektion von Wortvektoren Exercise 11: Ähnliche Wörter in einem Vokabular Exercise 12: Semantische Ähnlichkeit mit spaCy messen Exercise 13: Doc-Ähnlichkeit mit spaCy

Aktuelle Übung

Exercise 14: Span-Ähnlichkeit mit spaCy Exercise 15: Semantische Ähnlichkeit zur Kategorisierung von Text

Mach dich mit spaCy-Pipeline-Komponenten vertraut, lerne, wie du eine Pipeline-Komponente hinzufügst, und analysiere die NLP-Pipeline. Außerdem lernst du mehrere Ansätze für regelbasierte Informationsextraktion kennen, mit den Klassen EntityRuler, Matcher und PhraseMatcher in spaCy sowie dem Python-Paket RegEx.

Exercise 1: spaCy-Pipelines Exercise 2: Pipes in spaCy hinzufügen Exercise 3: Pipelines in spaCy analysieren Exercise 4: spaCy EntityRuler Exercise 5: EntityRuler mit leerem spaCy-Modell Exercise 6: EntityRuler für NER Exercise 7: EntityRuler mit mehreren Mustern in spaCy Exercise 8: RegEx mit spaCy Exercise 9: RegEx in Python Exercise 10: RegEx mit EntityRuler in spaCy Exercise 11: spaCy Matcher und PhraseMatcher Exercise 12: Einen einzelnen Begriff in spaCy matchen Exercise 13: PhraseMatcher in spaCy Exercise 14: Abgleichen mit erweiterter Syntax in spaCy

Erkunde mehrere praxisnahe Anwendungsfälle, in denen spaCy-Modelle versagen können, und lerne, wie du sie weitertrainierst, um die Modellleistung zu verbessern. Du wirst in die Trainingsschritte von spaCy eingeführt und verstehst, wie du ein vorhandenes spaCy-Modell oder eines von Grund auf trainierst und das Modell zur Inferenzzeit evaluierst.

Exercise 1: spaCy-Modelle anpassen Exercise 2: spaCy-Modelle trainieren Exercise 3: Modellleistung auf deinen Daten Exercise 4: spaCy-Trainingsdatenformat Exercise 5: Trainingsschritte Exercise 6: Annotation und Vorbereitung von Trainingsdaten Exercise 7: Kompatible Trainingsdaten Exercise 8: Training mit spaCy Exercise 9: Schritte zur Trainingsvorbereitung Exercise 10: Ein vorhandenes NER-Modell trainieren Exercise 11: Ein spaCy-Modell von Grund auf trainieren Exercise 12: Abschluss