Împărțirea piesei în acte
Conversia textului nestructurat în grafuri lexicale ierarhice este un proces iterativ care presupune crearea unor splittere pentru fiecare entitate lexicală și aplicarea lor pe rând.
În acest exercițiu, vei crea un splitter pentru a împărți piesa Romeo și Julieta în acte. Iată o previzualizare a structurii piesei:
The Project Gutenberg eBook of Romeo and Juliet
This ebook is for the use of anyone anywhere in the United States...
**PROLOGUE:**
Enter Chorus.
CHORUS.
Two households, both alike in dignity...
ACT I
SCENE I. A public place.
Enter Sampson and Gregory armed with swords and bucklers.
SAMPSON.
Gregory, on my word, we'll not carry coals...
...
Acest exercițiu face parte din cursul
Graph RAG cu LangChain și Neo4j
Instrucțiuni pentru exercițiu
- Actualizează argumentul
splitterspentru a împărți și textul după tiparul\n\nACT. - Configurează
act_splitterastfel încât să trateze listaseparatorsca expresii regulate. - Împarte
romeo_and_julietfolosindact_splitter.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
act_splitter = RecursiveCharacterTextSplitter(
separators=[
r"\n\nTHE PROLOGUE.",
r"\n\n\*\*\* END",
# Split by the word ACT
r"____"
],
# Configure the patterns as regular expressions
____=True
)
# Split the play using act_splitter
acts = act_splitter.____(____)
for act in acts:
print(act.strip().split("\n")[0])