Začněte nyníZačněte zdarma

Rozdělování HTML

V tomto cvičení rozdělíš HTML soubor obsahující výkonné nařízení o AI vydané Bílým domem v říjnu 2023. Aby si zachoval/a co nejvíce kontextu v jednotlivých úsecích, použiješ větší hodnoty chunk_size a chunk_overlap.

Všechny potřebné třídy LangChain jsou pro toto cvičení již předem načteny.

Toto cvičení je součástí kurzu

Vývoj LLM aplikací s LangChain

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř UnstructuredHTMLLoader pro soubor white_house_executive_order_nov_2023.html a načti ho do paměti.
  • Nastav chunk_size na 300 a chunk_overlap na 100.
  • Vytvoř RecursiveCharacterTextSplitter rozdělující na znaku '.' a pomocí metody .split_documents() rozděl data a vypiš jednotlivé úseky.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the HTML document into memory
loader = UnstructuredHTMLLoader(____)
data = loader.____()

# Define variables
chunk_size = ____
chunk_overlap = ____

# Split the HTML
splitter = RecursiveCharacterTextSplitter(
    chunk_size=chunk_size,
    chunk_overlap=chunk_overlap,
    separators=____)

docs = splitter.____(data)
print(docs)
Upravit a spustit kód