Das Stück in Akte aufteilen
Das Umwandeln unstrukturierter Texte in hierarchische lexikalische Graphen ist ein iterativer Prozess: Du erstellst Splitter für jede lexikalische Einheit und teilst den Text dann nacheinander anhand dieser Einheiten.
In dieser Übung entwirfst du einen Splitter, um das Stück Romeo and Juliet in Akte zu zerlegen. Hier siehst du einen Auszug aus der Struktur des Stücks:
The Project Gutenberg eBook of Romeo and Juliet
This ebook is for the use of anyone anywhere in the United States...
**PROLOGUE:**
Enter Chorus.
CHORUS.
Two households, both alike in dignity...
ACT I
SCENE I. A public place.
Enter Sampson and Gregory armed with swords and bucklers.
SAMPSON.
Gregory, on my word, we’ll not carry coals...
...
Diese Übung ist Teil des Kurses
<Kurs>Graph RAG mit LangChain und Neo4j</Kurs>Übungsanweisungen
- Aktualisiere das Argument
splitters, sodass der Text auch am Muster\n\nACTgetrennt wird. - Konfiguriere den
act_splitterso, dass die Listeseparatorsals reguläre Ausdrücke behandelt wird. - Teile
romeo_and_julietmitact_splitter.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
act_splitter = RecursiveCharacterTextSplitter(
separators=[
r"\n\nTHE PROLOGUE.",
r"\n\n\*\*\* END",
# Split by the word ACT
r"____"
],
# Configure the patterns as regular expressions
____=True
)
# Split the play using act_splitter
acts = act_splitter.____(____)
for act in acts:
print(act.strip().split("\n")[0])