시작하기무료로 시작하기

parquet 파일에서 데이터프레임 로드하기

작업 공간에는 sherlock_sentences.parquet라는 데이터프레임 파일이 있습니다. 이 데이터프레임의 각 행에는 하나의 절(clause)이 들어 있습니다. 각 절은 마침표, 따옴표 등 문장이나 문장 조각을 나타내는 구두점과 같은 자연어 구분 기호로 다른 절과 분리된 단어의 연속입니다. 이제 이 파일을 로드해 주세요.

이 연습은 강의의 일부입니다

Python에서 Spark SQL 입문

강의 보기

연습 안내

  • sherlock_sentences.parquet를 로드하세요.
  • "id > 70"로 필터링하고, 처음 5개 행을 표시하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Load the dataframe
df = ____('sherlock_sentences.parquet')

# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)
코드 편집 및 실행