본문 바로가기

리디 접속이 원활하지 않습니다.
강제 새로 고침(Ctrl + F5)이나 브라우저 캐시 삭제를 진행해주세요.
계속해서 문제가 발생한다면 리디 접속 테스트를 통해 원인을 파악하고 대응 방법을 안내드리겠습니다.
테스트 페이지로 이동하기

강화학습 기본과 PyTorch 제2판 상세페이지
  • 컴퓨터/IT컴퓨터/앱 활용

강화학습 기본과 PyTorch 제2판

  • 관심 0
  • 추상목 저자
소장
종이책 정가
30,000원
전자책 정가
30,000원
판매가
30,000원
소장
출간 정보
  • 2026.09.04 전자책 출간
  • 2026.08.31 종이책 출간
듣기 기능
TTS(듣기) 지원
파일 정보
  • PDF
  • 335 쪽
  • 16.1MB
지원 환경
  • PC뷰어
  • PAPER
ISBN
9791158088903
UCI
-
강화학습 기본과 PyTorch 제2판

작품 정보

신경망을 공부하다 보면 기계학습이 비지도 학습, 지도 학습, 그리고 강화학습으로 나뉜다는 설명을 자주 접하게 된다. 알파고나 자율 주행차에서 강화학습이 쓰인다는 이야기도 듣고, 아이가 세상과 부딪히며 배우는 과정을 본뜬 방법이라는 설명도 접하게 된다. 그러다 보면 자연스럽게 이런 생각이 든다.
‘강화학습을 공부해 볼까?’
그러나 막상 강화학습을 공부하려고 하면 생각보다 쉽지 않다. 첫째, 강화학습은 일반적인 신경망 학습 방식과 많이 다르다. 둘째, 방법이 매우 다양해서 무엇부터 어떤 순서로 공부해야 할지 막막하다. 셋째, 개념부터 코드까지 차근차근 안내해 주는 책을 찾기도 쉽지 않다.
이 책은 이러한 어려움을 조금이나마 덜어 주고자 썼다. 강화학습을 이해하려면 먼저 환경과 에이전트의 개념을 이해해야 한다. 이 두 개념은 비지도 학습과 지도 학습에는 직접적으로 나타나지 않는다. 그래서 강화학습 공부는 환경과 에이전트를 이해하는 데서 출발해야 한다. 여러 예제를 보면서 먼저 그림으로 환경과 에이전트를 이해하고, 그 내용을 다시 수식으로 표현해 보아야 한다. 그래야 에이전트가 왜 특정 행동을 선택하는지, 또 그 행동을 통해 현재와 미래의 보상을 어떻게 크게 만들어 가는지 차근차근 이해할 수 있다.
이 책도 이러한 흐름에 맞추어 차례를 잡았다. 제1장부터 4장까지는 환경을 알고 있을 때의 방법을 다루고, 제5장부터 9장까지는 환경을 모를 때의 방법을 다룬다. 또 다른 기준은 신경망 사용 여부이다. 제1장부터 6장까지는 신경망을 사용하지 않고, 제7장부터 9장까지는 신경망을 사용한다.
제1장부터 4장까지는 강화학습 공부의 기초에 해당하므로, 이 부분을 충분히 익혀 두어야 이후 내용을 무리 없이 따라갈 수 있다. 특히 제2장의 벨만 방정식 계산 문제는 생략하지 말고, 충분히 연습하기를 권한다. 5장과 6장에서는 환경을 모르지만, 신경망을 사용하지 않는 강화학습을 다룬다. 7장부터는 신경망을 사용하는 강화학습을 다룬다. 이때 제2장에서 공부한 벨만 방정식은 신경망 학습에서 손실을 정할 때 중요한 바탕이 된다.
이 책에서는 그림으로 개념을 잡고, 수식으로 구조를 확인한 뒤, 코드로 마무리하는 흐름을 중요하게 생각하였다. 특히 코드를 구현하기 전에 전체 구조와 데이터의 흐름을 그림으로 먼저 살펴볼 수 있도록 다양한 그림을 제시하였다. 독자가 그림으로 먼저 감을 잡고, 수식으로 구조를 확인한 뒤, 코드로 내용을 마무리할 수 있도록 하였다.
그림으로 개념 이해 → 수식으로 구조 확인 → 코드로 내용 마무리
이 책의 예제 코드는 2026년 7월 3일 Google Colab 환경에서 실행하여 확인하였다. 그러나 Google Colab은 시간이 지나면서 Python과 주요 라이브러리 버전이 변경될 수 있다. 따라서 나중에 코드를 실행하면 이 책에서 사용한 환경과 달라질 수 있고, 일부 코드의 실행 결과나 동작도 달라질 수 있다. 예제 코드 확인에 사용한 주요 실행 환경은 다음과 같다: Python 3.12.13, gym 0.25.2, numpy 2.0.2, matplotlib 3.10.0, torch 2.11.0+cpu, IPython 7.34.0
본 저서는 강화학습의 기본 이론에서 출발하여 깊은 Q-네트워크(Deep Q-Network, DQN)의 일부 내용까지 다룬다. 그리고 이 책에서 미처 다루지 못한 내용은 출간된 강화학습 시리즈 2 『강화학습 기본 다지기와 PyTorch』와 강화학습 시리즈 3 『강화학습 기본 완성과 PyTorch』에서 이어서 살펴본다. 세 권은 각각 독립적으로 읽을 수 있지만, 함께 공부하면 강화학습의 기초부터 심화까지 차례대로 익히는 데 도움이 될 것이다.
좋은 책이 되도록 힘썼지만, 미처 발견하지 못한 오류가 있을 수 있다. 이에 대해 독자여러분의 너른 양해를 구한다. 출간 후 확인되는 수정 사항이나 참고 자료는 자유아카데미 홈페이지 자료실(www.freeaca.com)에 올릴 예정이다.
2024년에 출간된 시리즈 1은 독자 여러분의 관심과 성원에 힘입어 2024 세종도서 학술 부문 도서로 선정되었고, 그 덕분에 2026년에 제2판을 펴내게 되었다. 제2판에서는 제1판의 오탈자를 바로잡고, 부족했던 그림과 개념 설명, 코드 설명을 전체적으로 보완하였다. 제2판을 준비하면서, 강화학습 시리즈의 첫 번째 책인 이 책이 어떤 역할을 해야 하는지 다시 생각했다. 그 답은 분명했다. 강화학습의 출발점을 차분히 안내하는 것이다. 이 책을 통해 독자들이 환경과 에이전트, 상태, 행동, 보상, 벨만 방정식을 이해하고, PyTorch 구현의 기초를 하나씩 익혀 가기를 바란다. 이 책을 바탕으로 시리즈 2와 시리즈 3을 함께 공부하면 강화학습의 기본 개념을 더 단단히 다지고, 심화 주제까지 차례대로 이해할 수 있을 것이다.

작가

추상목
작가의 대표 작품더보기

리뷰

0.0

구매자 별점
0명 평가

이 작품을 평가해 주세요!

건전한 리뷰 정착 및 양질의 리뷰를 위해 아래 해당하는 리뷰는 비공개 조치될 수 있음을 안내드립니다.
  1. 타인에게 불쾌감을 주는 욕설
  2. 비속어나 타인을 비방하는 내용
  3. 특정 종교, 민족, 계층을 비방하는 내용
  4. 해당 작품의 줄거리나 리디 서비스 이용과 관련이 없는 내용
  5. 의미를 알 수 없는 내용
  6. 광고 및 반복적인 글을 게시하여 서비스 품질을 떨어트리는 내용
  7. 저작권상 문제의 소지가 있는 내용
  8. 다른 리뷰에 대한 반박이나 논쟁을 유발하는 내용
* 결말을 예상할 수 있는 리뷰는 자제하여 주시기 바랍니다.
이 외에도 건전한 리뷰 문화 형성을 위한 운영 목적과 취지에 맞지 않는 내용은 담당자에 의해 리뷰가 비공개 처리가 될 수 있습니다.
아직 등록된 리뷰가 없습니다.
첫 번째 리뷰를 남겨주세요!
'구매자' 표시는 유료 작품 결제 후 다운로드하거나 리디셀렉트 작품을 다운로드 한 경우에만 표시됩니다.
무료 작품 (프로모션 등으로 무료로 전환된 작품 포함)
'구매자'로 표시되지 않습니다.
시리즈 내 무료 작품
'구매자'로 표시되지 않습니다. 하지만 같은 시리즈의 유료 작품을 결제한 뒤 리뷰를 수정하거나 재등록하면 '구매자'로 표시됩니다.
영구 삭제
작품을 영구 삭제해도 '구매자' 표시는 남아있습니다.
결제 취소
'구매자' 표시가 자동으로 사라집니다.

컴퓨터/앱 활용 베스트더보기

컴퓨터/앱 활용 베스트
  1. 클로드 코드 제대로 시작하기
  2. 좋은 코드 리뷰 나쁜 코드 리뷰
  3. 비전공자도 이해할 수 있는 LLM 수업
  4. 요즘 바이브 코딩 하네스 with 클로드 코드
  5. 개발자가 문서 작성도 잘해야 하나요?
  6. 이게 되네? GPT 이미지 2 미친 활용법 61제
  7. 누구나 아는 나만 모르는 클로드
  8. 세컨드 브레인은 옵시디언 with 클로드 코드
  9. 엑셀 2021
  10. 3줄의 글로 수익을 만드는 스레드 운영법

본문 끝 최상단으로 돌아가기

spinner
앱으로 연결해서 다운로드하시겠습니까?
닫기 버튼
대여한 작품은 다운로드 시점부터 대여가 시작됩니다.
앱으로 연결해서 보시겠습니까?
닫기 버튼
앱이 설치되어 있지 않으면 앱 다운로드로 자동 연결됩니다.