Découper du HTML
Dans cet exercice, vous allez découper un fichier HTML qui contient un décret présidentiel sur l'IA publié par la Maison-Blanche des États-Unis en octobre 2023. Pour conserver le plus de contexte possible dans les segments, vous utiliserez des valeurs plus élevées pour chunk_size et chunk_overlap.
Toutes les classes LangChain nécessaires pour réaliser cet exercice ont été préchargées pour vous.
Cette activité fait partie du cours
Développer des applications LLM avec LangChain
Instructions de l’exercice
- Créez un
UnstructuredHTMLLoaderpourwhite_house_executive_order_nov_2023.html, puis chargez-le en mémoire. - Définissez un
chunk_sizede300et unchunk_overlapde100. - Créez un
RecursiveCharacterTextSplitterqui découpe selon le caractère'.', puis utilisez la méthode.split_documents()pour découperdataet afficher les segments.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the HTML document into memory
loader = UnstructuredHTMLLoader(____)
data = loader.____()
# Define variables
chunk_size = ____
chunk_overlap = ____
# Split the HTML
splitter = RecursiveCharacterTextSplitter(
chunk_size=chunk_size,
chunk_overlap=chunk_overlap,
separators=____)
docs = splitter.____(data)
print(docs)