시작하기무료로 시작하기

Monte Carlo 방법을 위한 에피소드 생성

Monte Carlo 방법은 가치 함수를 도출하기 위해 에피소드 생성을 필요로 해요. 따라서 이제 에피소드가 종료될 때까지 무작위로 행동을 선택해 에피소드를 생성하는 함수를 구현해 보세요. 다음 연습 문제에서는 미리 로드된 사용자 정의 환경 env에 Monte Carlo 방법을 적용하기 위해 이 함수를 호출하게 돼요.

render() 함수는 미리 로드되어 있어요.

이 연습은 강의의 일부입니다

Python으로 배우는 Gymnasium 기반 Reinforcement Learning

강의 보기

연습 안내

  • seed를 42로 설정해 환경을 리셋하세요.
  • 에피소드 루프에서 각 반복마다 무작위 action을 선택하세요.
  • 한 반복이 끝나면 (state, action, reward) 튜플을 episode 데이터에 추가해 업데이트하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

def generate_episode():
    episode = []
    # Reset the environment
    state, info = ____
    terminated = False
    while not terminated:
      # Select a random action
      action = ____
      next_state, reward, terminated, truncated, info = env.step(action)
      render()
      # Update episode data
      episode.____(____)
      state = next_state
    return episode
print(generate_episode())
코드 편집 및 실행