HOME
eBook
- eBook
- 오디오(북)
- 동영상
IT/프로그래밍
- 경제경영
- 자기계발
- 시/에세이
- 인문
- 종교
- 소설
- 국어/외국어
- 정치/사회
- 역사/문화
- 과학/공학
- IT/프로그래밍
- 건강/의학
- 가정/생활/요리
- 여행/취미
- 예술/대중문화
- 유아
- 아동
- 청소년
- 교재/수험서
- 외국도서
- 매거진
- 대학교재
- 로맨스
- 로맨스판타지
- BL
- GL
- 판타지
- 무협
- 라이트노벨
- 추리
- 미스터리
- 스릴러
- 섹슈얼로맨스
- 단행본만화
- 웹툰
- 웹소설
컴퓨터공학
- IT일반/교양
- 컴퓨터입문/활용
- 컴퓨터수험서
- 컴퓨터공학
- 데이터베이스/아키텍처
- OS/네트워크
- 코딩/프로그래밍/언어
- OA (사무 보조 프로그램)
- 웹사이트/홈페이지/블로그
- 그래픽/디자인
- 영상/미디어
- 게임
- AI/AR/VR
- 기타

강화 학습

오일석 지음

한빛아카데미

2025년 07월 24일 출간

국내도서 : 2025년 07월 24일 출간

(개의 리뷰)

( 0% 의 구매자)

eBook 상품 정보

파일 정보 PDF (16.74MB) | 537 쪽

ISBN 9791173409653

지원기기 교보eBook App, PC e서재, 리더기, 웹뷰어

교보eBook App 듣기(TTS) 불가능

TTS 란?

텍스트를 음성으로 읽어주는 기술입니다.

전자책의 편집 상태에 따라 본문의 흐름과 다르게 텍스트를 읽을 수 있습니다.

이미지 형태로 제작된 전자책 (예 : ZIP 파일)은 TTS 기능을 지원하지 않습니다.

PDF 필기가능 (Android, iOS)

소득공제

소장

정가 : 38,000원

쿠폰적용가 34,200원

10% 할인 | 5%P 적립

이 상품은 배송되지 않는 디지털 상품이며,
교보eBook앱이나 웹뷰어에서 바로 이용가능합니다.

카드&결제 혜택

5만원 이상 구매 시 추가 2,000P
3만원 이상 구매 시, 등급별 2~4% 추가 최대 416P
리뷰 작성 시, e교환권 추가 최대 200원

상품정보
리뷰 (0)
이용안내

작품소개

이 상품이 속한 분야

이 책은 강화 학습의 기초부터 응용까지 체계적으로 배우고자 하는 독자를 대상으로 합니다. 먼저 문제 해결을 위한 새로운 아이디어를 소개하고 이를 뒷받침하는 기본 원리를 설명합니다. 이어서 수식에 기반한 알고리즘을 제시하고, TensorFlow와 Gymnasium을 사용한 프로그램을 실습하며 알고리즘을 실제 환경에서 직접 구현하고 학습 성능을 평가해 볼 수 있도록 내용을 구성하였습니다. 또한 전통적인 동적 프로그래밍부터 DQN, PPO, SAC 등 최신 알고리즘까지 다루고 있으며, 자율주행, 지능 로봇, AGI 등 고급 응용 분야와 최신 연구 흐름도 충실히 반영하고 있습니다.

※ 본 도서는 대학 강의용 교재로 개발되었으므로 연습문제 해답은 제공하지 않습니다.

CHAPTER 01 소개
1 강화 학습이란
2 기계 학습 = 지도 학습 + 비지도 학습 + 강화 학습
3 성공 사례와 응용 분야
4 간략 역사
5 읽을거리
연습문제

CHAPTER 02 강화 학습 기초 다지기
1 환경과 상호작용하는 에이전트
2 파이썬으로 MDP 프로그래밍
3 랜덤 정책과 최적 정책의 기대 이득 비교
4 정책과 가치 함수
5 강화 학습의 난이도와 접근방법 이해
연습문제

CHAPTER 03 동적 프로그래밍
1 원리
2 벨만 방정식과 정책 반복 알고리즘
3 벨만 최적 방정식과 가치 반복 알고리즘
4 스토캐스틱 과업의 동적 프로그래밍
5 동적 프로그래밍의 특성과 한계
연습문제

CHAPTER 04 몬테카를로 방법
1 에피소드 발생기
2 탐험과 탐사의 균형
3 몬테카를로 방법으로 정책 평가
4 몬테카를로 방법으로 정책 학습
5 성능 향상 기법
연습문제

CHAPTER 05 시간차 학습
1 원리
2 정책 평가
3 Sarsa
4 Q-러닝
5 Q-러닝으로 블랙잭 게임 학습
6 Q-러닝으로 CartPole 학습
7 성능 향상 기법
8 관점 확장
연습문제

CHAPTER 06 신경망을 이용한 근사 방법
1 신경망 기초
2 신경망 구현
3 신경망을 이용한 Q-러닝
4 신경망 기반 Q-러닝 구현: CartPole 과업
5 신경망 기반 Q-러닝 구현: Blackjack 과업
6 신경망에 대한 논쟁과 새로운 길
연습문제

CHAPTER 07 딥러닝 방법
1 딥러닝으로 대전환
2 DQN
3 리플레이 메모리
4 딥러닝 기초
5 아타리 게임 환경
6 DQN을 이용한 퐁 아타리 게임
7 덧붙이는 말
연습문제

CHAPTER 08 정책 그레이디언트 방법
1 정책이 중심인 학습
2 REINFORCE 알고리즘
3 REINFORCE 프로그래밍: 이산 과업
4 연속 과업을 위한 정책 그레이디언트
5 REINFORCE 프로그래밍: 연속 과업
6 파이썬의 배열 연산을 이용한 속도 향상
연습문제

CHAPTER 09 행동가 - 비평가 방법
1 행동가와 비평가의 협력
2 편향-분산 트레이드오프
3 이익 함수
4 A2C와 A3C
5 A2C 프로그래밍: 이산 과업
6 A2C 프로그래밍: 연속 과업
연습문제

CHAPTER 10 신뢰 영역 방법
1 단조 정책 개선
2 TRPO 알고리즘
3 PPO 알고리즘
4 PPO의 효율 향상
5 PPO 프로그래밍: 연속 과업
연습문제

CHAPTER 11 정책 최적화와 DQN의 결합
1 동기와 전개
2 DDPG 학습 알고리즘
3 프로그래밍 실습: DDPG를 이용한 Hopper 과업 학습
4 TD3 학습 알고리즘
5 프로그래밍 실습: TD3을 이용한 Hopper 과업 학습
6 SAC 학습 알고리즘
7 프로그래밍 실습: SAC를 이용한 Hopper 과업 학습
8 벤치마킹 분석
연습문제

CHAPTER 12 흉내 학습
1 발상과 전개
2 행위 복제
3 역강화 학습
4 적대 흉내 학습
5 관찰 흉내
연습문제

CHAPTER 13 고급 응용
1 강화 학습으로 만든 고급 제품: 기회와 도전
2 비디오 게임
3 보드 게임
4 대규모 언어 모델
5 자율주행
6 로봇
7 인공일반지능을 향하여
연습문제

참고문헌
찾아보기

인물정보

저자(글) 오일석

인물정보

대학/대학원 교수 컴퓨터공학자

전북대학교 컴퓨터인공지능학부 교수로 재직 중입니다. 서울대학교 컴퓨터공학부를 졸업하고, KAIST 전산학과에서 박사학위를 받았으며 주요 연구 분야는 기계학습, 컴퓨터 비전, 인공지능입니다. 저서로는 한빛아카데미의 『컴퓨터 비전과 딥러닝』 (세종도서 2023년 우수학술도서), 『파이썬으로 만드는 인공지능』 (세종도서 2021년 우수학술도서), 『R로 배우는 데이터 과학』, 『기계학습』 (대한민국학술원 2018년 우수학술도서), 『컴퓨터 비전』 (대한민국학술원 2015년 우수학술 도서)과 교보문고의 『패턴인식』 (문화체육관광부 2009년 우수학술도서), 『C 프로그래밍과 스타일링』 (2009년), 인피니티북스의 『세상을 여는 컴퓨터 이야기』 (2020년)가 있고 역서로는 한빛아카데미의 『앱인벤터2』 (2015년)가 있습니다.