간편결제, 신용카드 청구할인
삼성카드 6% (23,690원)
(삼성카드 6% 청구할인)
인터파크 롯데카드 5% (23,940원)
(최대할인 10만원 / 전월실적 40만원)
북피니언 롯데카드 30% (17,640원)
(최대할인 3만원 / 3만원 이상 결제)
NH쇼핑&인터파크카드 20% (20,160원)
(최대할인 4만원 / 2만원 이상 결제)
Close

수학으로 풀어보는 강화학습 원리와 알고리즘 : 딥러닝과 강화학습을 이해하기 위한 필수 수학 이론부터 다양한 강화학습 알고리즘, 모델 기반 강화학습까지

소득공제

2013년 9월 9일 이후 누적수치입니다.

판매지수 87
?
판매지수란?
사이트의 판매량에 기반하여 판매량 추이를 반영한 인터파크 도서에서의 독립적인 판매 지수입니다. 현재 가장 잘 팔리는 상품에 가중치를 두었기 때문에 실제 누적 판매량과는 다소 차이가 있을 수 있습니다. 판매량 외에도 다양한 가중치로 구성되어 최근의 이슈도서 확인시 유용할 수 있습니다. 해당 지수는 매일 갱신됩니다.
Close
공유하기
  • 저 : 박성수
  • 출판사 : 위키북스
  • 발행 : 2020년 02월 12일
  • 쪽수 : 408
  • 제품구성 : 전1권
  • ISBN : 9791158391904
정가

28,000원

  • 25,200 (10%할인)

    1,400P (5%적립)

할인혜택
적립혜택
  • I-Point 적립은 출고완료 후 14일 이내 마이페이지에서 적립받기한 경우만 적립됩니다.
추가혜택
배송정보
주문수량
감소 증가
  • 이벤트/기획전

  • 연관도서(54)

  • 사은품(3)

출판사 서평

코딩하면서 알고리즘이 유도된 과정이 궁금하다면 이 책을 선택하기 바랍니다!

이 책은 딥러닝이나 강화학습 예제를 코딩하면서 그 배경 알고리즘의 유도 과정을 궁금해하는 사람을 위한 책이다. 술술 읽히는 책은 아니지만 그렇다고 심하게 어려운 책도 아니다. 수학의 선수 지식으로 대학 2학년 때 배우는 공업수학을 이수한 정도면 충분하고, 딥러닝의 선수 지식으로는 텐서플로, 케라스, 파이토치를 사용해 MNIST와 같은 간단한 딥러닝 예제를 따라 해 본 정도면 충분하다.

이 책에서는 강화학습뿐만 아니라 다른 머신러닝과 딥러닝의 기초가 되는 확률이론과 추정론에 대한 기본적인 이해를 바탕으로 강화학습의 여러 알고리즘을 처음부터 끝까지 생략하지 않고 수식으로 유도했다.

강화학습이 추구하는 기본 목표로부터 A2C, A3C, PPO, DDPG 및 모델 기반 강화학습 등 강화학습의 알고리즘이 무엇이고 어떤 목적으로 개발됐는지, 어떻게 수학적으로 유도했는지, 그리고 어떻게 코드로 구현해 적용했는지를 구체적으로 설명한다.

★ 이 책에서 다루는 내용 ★

◎ 강화학습을 이해하기 위한 기본 수학: 확률론, 추정론, 최적화, 벡터/행렬의 미분
◎ 강화학습 알고리즘: A2C, A3C, PPO, DDPG
◎ 최적제어 알고리즘: 반복적 LQR, 가우시안 LQR
◎ 로컬 모델 기반 강화학습: GMM, 모델 피팅 방법, LQR을 이용한 강화학습

목차

▣ 01장: 강화학습 수학
1.1 확률과 랜덤 변수
1.1.1 확률
1.1.2 랜덤 변수
1.1.3 누적분포함수와 확률밀도함수
1.1.4 결합 확률함수
1.1.5 조건부 확률함수
1.1.6 독립 랜덤 변수
1.1.7 랜덤 변수의 함수
1.1.8 베이즈 정리
1.1.9 샘플링
1.2 기댓값과 분산
1.2.1 기댓값
1.2.2 분산
1.2.3 조건부 기댓값과 분산
1.3 랜덤벡터
1.3.1 정의
1.3.2 기댓값과 공분산 행렬
1.3.3 샘플 평균
1.4 가우시안 분포
1.5 랜덤 시퀀스
1.5.1 정의
1.5.2 평균함수와 자기 상관함수
1.5.3 마르코프 시퀀스
1.6 선형 확률 차분방정식
1.7 표기법
1.8 중요 샘플링
1.9 엔트로피
1.10 KL 발산
1.11 추정기
1.11.1 최대사후 추정기
1.11.2 최대빈도 추정기
1.12 벡터와 행렬의 미분
1.12.1 벡터로 미분
1.12.2 행렬로 미분
1.13 촐레스키 분해
1.14 경사하강법
1.14.1 배치 경사하강법
1.14.2 확률적 경사하강법
1.15 경사하강법의 개선
1.15.1 모멘텀
1.15.2 RMSprop
1.15.3 아담
1.16 손실함수의 확률론적 해석
1.16.1 가우시안 오차 분포
1.16.2 베르누이 오차 분포

▣ 2장: 강화학습 개념
2.1 강화학습 개요
2.2 강화학습 프로세스와 표기법
2.3 마르코프 결정 프로세스
2.3.1 정의
2.3.2 가치함수
2.3.3 벨만 방정식
2.3.4 벨만 최적 방정식
2.4 강화학습 방법

▣ 3장: 정책 그래디언트
3.1 배경
3.2 목적함수
3.3 정책 그래디언트
3.4 REINFORCE 알고리즘

▣ 4장: A2C
4.1 배경
4.2 그래디언트의 재구성
4.3 분산을 감소시키기 위한 방법
4.4 A2C 알고리즘
4.5 A2C 알고리즘 구현
4.5.1 테스트 환경
4.5.2 코드 개요
4.5.3 액터 클래스
4.5.4 크리틱 클래스
4.5.5 액터-크리틱 에이전트 클래스
4.5.6 학습 결과
4.5.7 전체 코드

▣ 5장: A3C
5.1 배경
5.2 그래디언트 계산의 문제
5.2.1 샘플의 상관관계
5.2.2 n-스텝 가치 추정
5.2.3 엔트로피 보너스
5.3 비동기 액터-크리틱(A3C) 알고리즘
5.4 그래디언트 병렬화 방식의 A3C 알고리즘 구현
5.4.1 테스트 환경
5.4.2 코드 개요
5.4.3 액터 클래스
5.4.4 크리틱 클래스
5.4.5 액터-크리틱 에이전트 클래스
5.4.6 학습 결과
5.4.7 전체 코드
5.5 데이터 병렬화 방식의 A3C 알고리즘 구현
5.5.1 코드 개요
5.5.2 전체 코드

▣ 6장: PPO
6.1 배경
6.2 그래디언트의 재구성
6.3 정책 업데이트와 성능
6.4 PPO 알고리즘
6.5 어드밴티지 추정의 일반화 (GAE)
6.6 PPO 알고리즘 구현
6.6.1 테스트 환경
6.6.2 코드 개요
6.6.3 액터 클래스
6.6.4 크리틱 클래스
6.6.5 액터-크리틱 에이전트 클래스
6.6.6 학습 결과
6.6.7 전체 코드

▣ 7장: DDPG
7.1 배경
7.2 그래디언트의 재구성
7.3 DDPG 알고리즘
7.4 DDPG 알고리즘 구현
7.4.1 테스트 환경
7.4.2 코드 개요
7.4.3 액터 클래스
7.4.4 크리틱 클래스
7.4.5 액터-크리틱 에이전트 클래스
7.4.6 학습 결과
7.4.7 전체 코드

▣ 08장: 모델 기반 강화학습 기초
8.1 배경
8.2 최적제어
8.2.1 LQR
8.2.2 확률적 LQR
8.2.3 가우시안 LQR
8.2.4 반복적 LQR
8.3 모델 학습 방법

▣ 09장: 로컬 모델 기반 강화학습
9.1 배경
9.2 로컬 모델 피팅 기반 LQR
9.3 로컬 모델 피팅
9.3.1 조건부 가우시안 방법
9.3.2 GMM 사전분포를 이용한 로컬 모델 업데이트
9.4 로컬 제어 법칙 업데이트
9.4.1 대체 비용함수 계산
9.4.2 KL 발산 계산
9.4.3 h 조정
9.4.4 e 조정
9.5 가우시안 LQR을 이용한 강화학습 알고리즘
9.6 가우시안 LQR을 이용한 강화학습 알고리즘 구현
9.6.1 테스트 환경
9.6.2 코드 개요
9.6.3 궤적 생성
9.6.4 로컬 모델 피팅
9.6.5 가우시안 LQR
9.6.6 가우시안 혼합 모델
9.6.7 LQR-FLM 에이전트 클래스
9.6.8 학습 결과
9.6.9 전체 코드
9.7 GPS로의 발전

▣ 참고문헌
▣ 참고코드

관련이미지

저자소개

생년월일 -
출생지 -
출간도서 0종
판매수 0권

서울대학교 항공우주공학과에서 학사, 동 대학교 대학원에서 석사, 그리고 국비유학으로 미국 UC Berkeley에서 박사학위를 받았다. 유학가기 전에 국방과학연구소에서 연구원으로 일했으며, 박사후에는 UC Berkeley ITS 연구소에서 포스트닥 연구원으로 일했다. 현재 세종대학교 항공우주공학과 교수이며, 유도항법제어 및 AI for Dynamics and Control 분야를 연구하고 있다.

◎ 개인 블로그: https://pasus.tistory.com/

이 상품의 시리즈

(총 73권 / 현재구매 가능도서 53권)

펼쳐보기

컴퓨터/인터넷 분야에서 많은 회원이 구매한 책

    리뷰

    0.0 (총 0건)

    구매 후 리뷰 작성 시, 북피니언 지수 최대 600점

    리뷰쓰기

    기대평

    작성시 유의사항

    평점
    0/200자
    등록하기

    기대평

    10.0

    교환/환불

    교환/환불 방법

    ‘마이페이지 > 취소/반품/교환/환불’ 에서 신청함, 1:1 문의 게시판 또는 고객센터(1577-2555) 이용 가능

    교환/환불 가능 기간

    고객변심은 출고완료 다음날부터 14일 까지만 교환/환불이 가능함

    교환/환불 비용

    고객변심 또는 구매착오의 경우에만 2,500원 택배비를 고객님이 부담함

    교환/환불 불가사유

    반품접수 없이 반송하거나, 우편으로 보낼 경우 상품 확인이 어려워 환불이 불가할 수 있음
    배송된 상품의 분실, 상품포장이 훼손된 경우, 비닐랩핑된 상품의 비닐 개봉시 교환/반품이 불가능함

    소비자 피해보상

    소비자 피해보상의 분쟁처리 등에 관한 사항은 소비자분쟁해결기준(공정거래위원회 고시)에 따라 비해 보상 받을 수 있음
    교환/반품/보증조건 및 품질보증 기준은 소비자기본법에 따른 소비자 분쟁 해결 기준에 따라 피해를 보상 받을 수 있음

    기타

    도매상 및 제작사 사정에 따라 품절/절판 등의 사유로 주문이 취소될 수 있음(이 경우 인터파크도서에서 고객님께 별도로 연락하여 고지함)

    배송안내

    • 인터파크 도서 상품은 택배로 배송되며, 출고완료 1~2일내 상품을 받아 보실 수 있습니다

    • 출고가능 시간이 서로 다른 상품을 함께 주문할 경우 출고가능 시간이 가장 긴 상품을 기준으로 배송됩니다.

    • 군부대, 교도소 등 특정기관은 우체국 택배만 배송가능하여, 인터파크 외 타업체 배송상품인 경우 발송되지 않을 수 있습니다.

    • 배송비

    도서(중고도서 포함) 구매

    2,000원 (1만원이상 구매 시 무료배송)

    음반/DVD/잡지/만화 구매

    2,000원 (2만원이상 구매 시 무료배송)

    도서와 음반/DVD/잡지/만화/
    중고직배송상품을 함께 구매

    2,000원 (1만원이상 구매 시 무료배송)

    업체직접배송상품 구매

    업체별 상이한 배송비 적용