ПочатиПочніть безкоштовно

Розбиття файлів Python

Хоча текстові й кодові файли містять ті самі символи, у файлах коду є структури, що виходять за межі природної мови. Щоб зберегти цей контекст, специфічний для коду, під час розбиття документів, варто налаштувати розділювач так, щоб він спочатку намагався розбивати за найпоширенішими кодовими структурами. На щастя, LangChain надає для цього готову функціональність!

Усі потрібні класи вже імпортовано для вас, зокрема Language з langchain_text_splitters.

Ця вправа є частиною курсу

Retrieval Augmented Generation (RAG) з LangChain

Переглянути курс

Інструкції до вправи

  • Створіть рекурсивний символьний розділювач, який розбиватиме за поширеними структурами коду Python.
  • Розбийте завантажувач документів python_data на частини.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create a Python-aware recursive character splitter
python_splitter = RecursiveCharacterTextSplitter.____(
    ____, chunk_size=300, chunk_overlap=100
)

# Split the Python content into chunks
chunks = ____

for i, chunk in enumerate(chunks[:3]):
    print(f"Chunk {i+1}:\n{chunk.page_content}\n")
Редагувати та запускати код