Dela upp pjäsen i akter
Att konvertera ostrukturerad text till hierarkiska lexikala grafer är en iterativ process där du bygger delare för varje lexikal enhet och sedan delar upp texten i tur och ordning.
I den här övningen utformar du en delare som delar upp pjäsen Romeo och Julia i akter. Här är en förhandstitt på pjäsens struktur:
The Project Gutenberg eBook of Romeo and Juliet
This ebook is for the use of anyone anywhere in the United States...
**PROLOGUE:**
Enter Chorus.
CHORUS.
Two households, both alike in dignity...
ACT I
SCENE I. A public place.
Enter Sampson and Gregory armed with swords and bucklers.
SAMPSON.
Gregory, on my word, we'll not carry coals...
...
Den här övningen är en del av kursen
Graph RAG med LangChain och Neo4j
Övningsinstruktioner
- Uppdatera argumentet
splittersså att texten även delas på mönstret\n\nACT. - Konfigurera
act_splitterså att listanseparatorsbehandlas som reguljära uttryck. - Dela upp
romeo_and_julietmed hjälp avact_splitter.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
act_splitter = RecursiveCharacterTextSplitter(
separators=[
r"\n\nTHE PROLOGUE.",
r"\n\n\*\*\* END",
# Split by the word ACT
r"____"
],
# Configure the patterns as regular expressions
____=True
)
# Split the play using act_splitter
acts = act_splitter.____(____)
for act in acts:
print(act.strip().split("\n")[0])