LoslegenKostenlos starten

Das Stück in Akte aufteilen

Das Umwandeln unstrukturierter Texte in hierarchische lexikalische Graphen ist ein iterativer Prozess: Du erstellst Splitter für jede lexikalische Einheit und teilst den Text dann nacheinander anhand dieser Einheiten.

In dieser Übung entwirfst du einen Splitter, um das Stück Romeo and Juliet in Akte zu zerlegen. Hier siehst du einen Auszug aus der Struktur des Stücks:

The Project Gutenberg eBook of Romeo and Juliet
This ebook is for the use of anyone anywhere in the United States...

**PROLOGUE:**

 Enter Chorus.

CHORUS.
Two households, both alike in dignity...

ACT I

SCENE I. A public place.
 Enter Sampson and Gregory armed with swords and bucklers.

SAMPSON.
Gregory, on my word, we’ll not carry coals...
...

Diese Übung ist Teil des Kurses

<Kurs>Graph RAG mit LangChain und Neo4j</Kurs>
Kurs ansehen

Übungsanweisungen

  • Aktualisiere das Argument splitters, sodass der Text auch am Muster \n\nACT getrennt wird.
  • Konfiguriere den act_splitter so, dass die Liste separators als reguläre Ausdrücke behandelt wird.
  • Teile romeo_and_juliet mit act_splitter.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

act_splitter = RecursiveCharacterTextSplitter(
  separators=[ 
    r"\n\nTHE PROLOGUE.",
    r"\n\n\*\*\* END",
    # Split by the word ACT
    r"____"
  ],
  # Configure the patterns as regular expressions
  ____=True
)

# Split the play using act_splitter
acts = act_splitter.____(____)

for act in acts:
  print(act.strip().split("\n")[0])
Code bearbeiten und ausführen