ÎncepețiÎncepe gratuit

Împărțirea piesei în acte

Conversia textului nestructurat în grafuri lexicale ierarhice este un proces iterativ care presupune crearea unor splittere pentru fiecare entitate lexicală și aplicarea lor pe rând.

În acest exercițiu, vei crea un splitter pentru a împărți piesa Romeo și Julieta în acte. Iată o previzualizare a structurii piesei:

The Project Gutenberg eBook of Romeo and Juliet
This ebook is for the use of anyone anywhere in the United States...

**PROLOGUE:**

 Enter Chorus.

CHORUS.
Two households, both alike in dignity...

ACT I

SCENE I. A public place.
 Enter Sampson and Gregory armed with swords and bucklers.

SAMPSON.
Gregory, on my word, we'll not carry coals...
...

Acest exercițiu face parte din cursul

Graph RAG cu LangChain și Neo4j

Vezi cursul

Instrucțiuni pentru exercițiu

  • Actualizează argumentul splitters pentru a împărți și textul după tiparul \n\nACT.
  • Configurează act_splitter astfel încât să trateze lista separators ca expresii regulate.
  • Împarte romeo_and_juliet folosind act_splitter.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

act_splitter = RecursiveCharacterTextSplitter(
  separators=[ 
    r"\n\nTHE PROLOGUE.",
    r"\n\n\*\*\* END",
    # Split by the word ACT
    r"____"
  ],
  # Configure the patterns as regular expressions
  ____=True
)

# Split the play using act_splitter
acts = act_splitter.____(____)

for act in acts:
  print(act.strip().split("\n")[0])
Editează și rulează codul