본문 바로가기

추천 검색어

실시간 인기 검색어

9가지 사례로 익히는 고급 스파크 분석

현실 세계 빅데이터로 배우는 데이터 과학과 머신러닝
한빛미디어

2018년 03월 20일 출간

종이책 : 2018년 02월 23일 출간

(개의 리뷰)
( 0% 의 구매자)
eBook 상품 정보
파일 정보 pdf (25.40MB)
ISBN 9791162249697
지원기기 교보eBook App, PC e서재, 리더기, 웹뷰어
교보eBook App 듣기(TTS) 가능
TTS 란?
텍스트를 음성으로 읽어주는 기술입니다.
  • 전자책의 편집 상태에 따라 본문의 흐름과 다르게 텍스트를​ 읽을 수 있습니다.
  • 이미지 형태로 제작된 전자책 (예 : ZIP 파일)은 TTS 기능을 지원하지 않습니다.

PDF 필기가능 (Android, iOS)
소득공제
소장
정가 : 20,800원

쿠폰적용가 18,720

10% 할인 | 5%P 적립

이 상품은 배송되지 않는 디지털 상품이며,
교보eBook앱이나 웹뷰어에서 바로 이용가능합니다.

카드&결제 혜택

  • 5만원 이상 구매 시 추가 2,000P
  • 3만원 이상 구매 시, 등급별 2~4% 추가 최대 416P
  • 리뷰 작성 시, e교환권 추가 최대 200원

작품소개

이 상품이 속한 분야

다양한 현실 세계 예제로 스파크 2의 진면목을 경험한다.
이 책은 독자에게 대량의 데이터셋을 가지고 스파크 2를 활용해 복잡한 분석과 머신러닝 학습을 실제로 해보는 생생한 느낌을 전달한다. 단순히 모델을 구축하고 평가하는 데 그치지 않고, 데이터 정제부터 전처리, 데이터 조사, 실제 제품을 만들기까지의 전체 파이프라인을 보여준다. 이러한 과정을 다양한 분야에서 가져온 현실 예제에 맞게 교차 최소 제곱 추천 알고리즘, 의사 결정 나무, K-평균 군집화, 숨은 의미 분석, 세션화, 몬테카를로 시뮬레이션 등의 기법을 동원해 풀어본다.
1장. 빅데이터 분석하기
1.1 데이터 과학의 어려움
1.2 아파치 스파크란
1.3 이 책에 관하여
1.4 2판에 관하여

2장. 스칼라와 스파크를 활용한 데이터 분석
2.1 데이터 과학자를 위한 스칼라
2.2 스파크 프로그래밍 모델
2.3 레코드 링크
2.4 스파크 셸과 SparkContext 시작하기
2.5 클러스터에서 클라이언트로 데이터 가져오기
2.6 클라이언트에서 클러스터로 코드 보내기
2.7 RDD에서 Data Frame으로
2.8 DataFrame API로 데이터 분석하기
2.9 데이터프레임에 대한 빠른 요약 통계
2.10 데이터프레임의 축 회전과 형태변환
2.11 데이터프레임을 결합하고 특징 선택하기
2.12 실제 환경을 위한 모델 준비하기
2.13 모델 평가
2.14 한 걸음 더 나아가기

3장. 음악 추천과 Audioscrobbler 데이터셋
3.1 데이터셋
3.2 교차 최소 제곱 추천 알고리즘
3.3 데이터 준비하기
3.4 첫 번째 모델 만들기
3.5 추천 결과 추출 검사하기
3.6 추천 품질 평가하기
3.7 AUC 계산하기
3.8 하이퍼파라미터 선택하기
3.9 추천 결과 만들기
3.10 한 걸음 더 나아가기

4장. 의사 결정 나무로 산림 식생 분포 예측하기
4.1 회귀로 돌아와서
4.2 벡터와 특징
4.3 학습 예제
4.4 의사 결정 나무와 랜덤 포레스트
4.5 Covtype 데이터셋
4.6 데이터 준비하기
4.7 첫 번째 의사 결정 나무
4.8 의사 결정 나무 하이퍼파라미터
4.9 의사 결정 나무 튜닝하기
4.10 범주형 특징 다시 살펴보기
4.11 랜덤 포레스트
4.12 예측하기
4.13 한 걸음 더 나아가기

5장. K-평균 군집화로 네트워크 이상 탐지하기
5.1 이상 탐지
5.2 K-평균 군집화
5.3 네트워크 침입
5.4 KDD 컵 1999 데이터셋
5.5 첫 번째 군집화하기
5.6 k 선정하기
5.7 R에서 시각화하기
5.8 특징 정규화
5.9 범주형 변수
5.10 엔트로피와 함께 레이블 활용하기
5.11 군집화하기
5.12 한 걸음 더 나아가기

6장. 숨은 의미 분석으로 위키백과 이해하기
6.1 문서-단어 행렬
6.2 데이터 구하기
6.3 파싱하여 데이터 준비하기
6.4 표제어 추출
6.5 단어빈도-역문서빈도(TF-IDF) 계산하기
6.6 특잇값 분해
6.7 중요한 의미 찾기
6.8 낮은 차원 표현에 대한 의문과 고찰
6.9 단어와 단어 사이의 연관도
6.10 문서와 문서 사이의 연관도
6.11 문서와 단어 사이의 연관도
6.12 여러 개의 단어로 질의하기
6.13 한 걸음 더 나아가기

7장. 그래프엑스로 동시발생 네트워크 분석하기
7.1 네트워크 분석 사례: MEDLINE의 인용 색인
7.2 데이터 구하기
7.3 스칼라 XML 라이브러리로 XML 문서 파싱하기
7.4 MeSH 주요 주제와 주제들의 동시발생 분석하기
7.5 그래프엑스로 동시발생 네트워크 구성하기
7.6 네트워크의 구조 이해하기
7.7 관련성 낮은 관계 필터링하기
7.8 작은 세상 네트워크
7.9 한 걸음 더 나아가기

8장. 뉴욕 택시 운행 데이터로 위치 및 시간 데이터 분석하기
8.1 데이터 얻기
8.2 스파크에서 서드파티 라이브러리로 작업하기
8.3 지리 데이터와 Esri Geometry API, 그리고 Spray
8.4 뉴욕 택시 운행 데이터 준비하기
8.5 스파크에서 세션화 작업 수행하기
8.6 한 걸음 더 나아가기

9장. 몬테카를로 시뮬레이션으로 금융 리스크 추정하기
9.1 전문 용어
9.2 VaR 계산 방법
9.3 우리의 모델
9.4 데이터 구하기
9.5 전처리하기
9.6 요인 가중치 결정하기
9.7 표본추출
9.8 실험 실행하기
9.9 수익 분포 시각화하기
9.10 결과 평가하기
9.11 한 걸음 더 나아가기

10장. BDG 프로젝트와 유전체학 데이터 분석하기
10.1 모델링과 저장소를 분리하기
10.2 ADAM CLI를 이용한 유전체학 데이터 처리
10.3 ENCODE 데이터로부터 전사인자 결합 부위 예측하기
10.4 1000 지놈 프로젝트에서 유전자형 질의하기
10.5 한 걸음 더 나아가기

11장. 파이스파크와 썬더로 신경 영상 데이터 분석하기
11.1 파이스파크 소개
11.2 썬더 라이브러리 개요와 설치
11.3 썬더로 데이터 읽어 들이기
11.4 썬더로 신경 세포 유형 분류하기
11.5 한 걸음 더 나아가기

스파크 2 실전편! 실무와 가장 가까운 경험을 제공한다.

이 책은 기능과 API를 단조롭게 나열하지 않는다. 현실과 동떨어진, 예제를 위한 예제를 따라 하지도 않는다. 대신 우리 주변에서 찾을 수 있고 우리 삶과 밀접한 실제 데이터를 가져와 함께 분석하고 다듬어본다. 그것도 하나가 아니라 9가지다. 음악 추천부터 이상 탐지, 교통, 금융, 영상 데이터 등 관심 가는 장을 먼저 봐도 좋고, 차례대로 천천히 따라 해도 좋다. 그럼 가장 진보한 분석 도구인 스파크 2로 다 함께 데이터의 바다를 항해해보자!

2판에 관하여
1판이 출간된 이후 스파크의 메이저 버전이 올라가면서 완전히 새로운 핵심 API가 도입되고 MLlib이나 Spark SQL과 같은 하위 컴포넌트들도 크게 바뀌었다. 이러한 변화들이 반영되다 보니, 이 책 초판의 많은 부분이 의미가 없게 되었다. 이번 2판은 새로운 스파크 API를 사용하기 위해서 모든 장을 수정하였다.

주요 내용
1. 오디오스크로블러(AudioScrobbler) 데이터셋으로 음악 추천하기
2. 의사 결정 나무로 산림 식생 분포 예측하기
3. K-평균 군집화로 네트워크 이상 탐지하기
4. 숨은 의미 분석으로 위키백과 이해하기
5. 그래프엑스(GraphX)로 동시발생 네트워크 분석하기
6. 뉴욕 택시 운행 데이터로 위치 및 시간 데이터 분석하기
7. 몬테카를로 시뮬레이션으로 금융 리스크 추정하기
8. BDG 프로젝트와 유전체학 데이터 분석하기
9. 파이스파크(PySpark)와 썬더(Thunder)로 신경 영상 데이터 분석하기

관련 도서 (제목 + ISBN)
●처음 배우는 데이터 과학 / 9791162240472
●파이썬 라이브러리를 활용한 데이터 분석(수정보완판) / 9788968480478
●파이썬 라이브러리를 활용한 머신러닝 / 9788968483394
●파이썬을 활용한 금융 분석 / 9788968482779

작가정보

저자(글) 샌디 라이자

저자 샌디 라이자 Sandy Ryzas는 리믹스에서 대중교통에 적용할 수 있는 알고리즘을 개발하고 있다. 이전에는 클라우데라와 클로버 헬스에서 선임 데이터 과학자로 근무했다. 아파치 스파크 커미터이자 아파치 하둡의 PMC 멤버이며 스파크 시계열 데이터 처리 프로젝트의 창설자다. 2012년 브라운 대학교 전산학과의 트와이닝 어워즈에서 ‘Most Chill’ 부문을 수상했다.

저자 유리 레이저슨 Uri Laserson은 마운트 시나이 의과대학교 아이칸 스쿨의 유전학 조교수다. 하둡 생태계를 활용해 유전체학과 면역학에 적용할 수 있는 확장 가능한 기술을 개발하고 있다.

저자(글) 션 오언

저자 션 오언 Sean Owen은 클라우데라 데이터 과학팀의 디렉터다. 아파치 스파크 커미터와 PMC 멤버이며, 아파치 머하웃(Apache Mahout)의 커미터였다.

저자(글) 조시 윌스

저자 조시 윌스 Josh Wills는 슬랙(Slack) 데이터 엔지니어링팀의 리더이며 아파치 크런치(Apache Crunch) 프로젝트의 창설자다. 데이터 과학자들에 관한 트윗을 한 번 남긴 적이 있다.

역자 박상은은 컴퓨터에 붙은 그림을 보고 애플이라는 단어의 뜻을 알게 된 이 땅의 흔한 개발자 중 한 사람이다. 포항공과대학교에서 전산학을, 한국과학기술원에서 인공지능을 공부했으며, 그 덕분에 알파고와 스카이넷을 구분할 줄 아는 지혜를 갖추게 되었다. 메일, 브라우저, CMS, 도서 관리 시스템 등 일관성을 찾기 어려운 다양한 프로젝트에 참여했다. 이렇게 하여 물에 물 탄듯한 경력이 완성되는 듯했으나, 최근 몇 년은 빅데이터 처리와 관련한 연구개발에 집중했다. 현재 에스코어에서 일래스틱(Elastic) 스택을 활용한 빅데이터 저장/검색 서비스 제공과 머신러닝 및 딥러닝 관련 업무를 수행하고 있다. 대량의 데이터를 실시간으로 수집, 처리, 분석하여, 실시간으로 생산되는 데이터의 수집과 시각화 사이의 시간 간격을 줄이는 데 각별한 관심이 있다.

역자 권한철은 에스코어의 데이터 분석가 및 플랫폼 개발자다. 보안 관제용 실시간 CEP 엔진 개발을 비롯해서 스파크를 활용한 다수의 프로젝트에 참여했으며, 현재는 파이썬 라이브러리를 활용하여 콜센터 데이터 분석 업무를 수행하고 있다. 특히 실시간 데이터 분석과 통계 및 머신러닝 알고리즘을 활용한 데이터 분석에 관심이 많다.

역자 서양주는 한국과학기술원 학부에서 수학을, 서울대학교에서 석사과정으로 통계학을 전공하였으며, 티맥스소프트를 시작으로 개발자로서 일하게 되었다. 그 후 에스코어에서 2013년 하둡과 스파크를 접한 이후로 빅데이터 분석을 주 업무로 수행하게 되었다. 현재는 카카오 추천팀에서 실시간 콘텐츠 추천 업무를 하고 있다.

이 상품의 총서

Klover리뷰 (0)

Klover리뷰 안내
Klover(Kyobo-lover)는 교보를 애용해 주시는 고객님들이 남겨주신 평점과 감상을 바탕으로, 다양한 정보를 전달하는 교보문고의 리뷰 서비스입니다.
1. 리워드 안내
구매 후 90일 이내에 평점 작성 시 e교환권 100원을 적립해 드립니다.
  • - e교환권은 적립일로부터 180일 동안 사용 가능합니다.
  • - 리워드는 1,000원 이상 eBook, 오디오북, 동영상에 한해 다운로드 완료 후 리뷰 작성 시 익일 제공됩니다.
  • - 리워드는 한 상품에 최초 1회만 제공됩니다.
  • - sam 이용권 구매 상품 / 선물받은 eBook은 리워드 대상에서 제외됩니다.
2. 운영 원칙 안내
Klover리뷰를 통한 리뷰를 작성해 주셔서 감사합니다. 자유로운 의사 표현의 공간인 만큼 타인에 대한 배려를 부탁합니다. 일부 타인의 권리를 침해하거나 불편을 끼치는 것을 방지하기 위해 아래에 해당하는 Klover 리뷰는 별도의 통보 없이 삭제될 수 있습니다.
  • 도서나 타인에 대해 근거 없이 비방을 하거나 타인의 명예를 훼손할 수 있는 리뷰
  • 도서와 무관한 내용의 리뷰
  • 인신공격이나 욕설, 비속어, 혐오 발언이 개재된 리뷰
  • 의성어나 의태어 등 내용의 의미가 없는 리뷰

구매 후 리뷰 작성 시, e교환권 100원 적립

문장수집

문장수집 안내
문장수집은 고객님들이 직접 선정한 책의 좋은 문장을 보여 주는 교보문고의 새로운 서비스 입니다. 교보eBook 앱에서 도서 열람 후 문장 하이라이트 하시면 직접 타이핑 하실 필요 없이 보다 편하게 남길 수 있습니다. 마음을 두드린 문장들을 기록하고 좋은 글귀들은 ‘좋아요’ 하여 모아보세요. 도서 문장과 무관한 내용 등록 시 별도 통보없이 삭제될 수 있습니다.
리워드 안내
  • 구매 후 90일 이내에 문장 수집 등록 시 e교환권 100원을 적립해 드립니다.
  • e교환권은 적립일로부터 180일 동안 사용 가능합니다.
  • 리워드는 1,000원 이상 eBook에 한해 다운로드 완료 후 문장수집 등록 시 제공됩니다.
  • 리워드는 한 상품에 최초 1회만 제공됩니다.
  • sam 이용권 구매 상품 / 선물받은 eBook / 오디오북·동영상 상품/주문취소/환불 시 리워드 대상에서 제외됩니다.

구매 후 문장수집 작성 시, e교환권 100원 적립

    교보eBook 첫 방문을 환영 합니다!

    신규가입 혜택 지급이 완료 되었습니다.

    바로 사용 가능한 교보e캐시 1,000원 (유효기간 7일)
    지금 바로 교보eBook의 다양한 콘텐츠를 이용해 보세요!

    교보e캐시 1,000원
    TOP
    신간 알림 안내
    9가지 사례로 익히는 고급 스파크 분석 웹툰 신간 알림이 신청되었습니다.
    신간 알림 안내
    9가지 사례로 익히는 고급 스파크 분석 웹툰 신간 알림이 취소되었습니다.
    리뷰작성
    • 구매 후 90일 이내 작성 시, e교환권 100원 (최초1회)
    • 리워드 제외 상품 : 마이 > 라이브러리 > Klover리뷰 > 리워드 안내 참고
    • 콘텐츠 다운로드 또는 바로보기 완료 후 리뷰 작성 시 익일 제공
    감성 태그

    가장 와 닿는 하나의 키워드를 선택해주세요.

    사진 첨부(선택) 0 / 5

    총 5MB 이하로 jpg,jpeg,png 파일만 업로드 가능합니다.

    신고/차단

    신고 사유를 선택해주세요.
    신고 내용은 이용약관 및 정책에 의해 처리됩니다.

    허위 신고일 경우, 신고자의 서비스 활동이 제한될 수
    있으니 유의하시어 신중하게 신고해주세요.


    이 글을 작성한 작성자의 모든 글은 블라인드 처리 됩니다.

    문장수집 작성

    구매 후 90일 이내 작성 시, e교환권 100원 적립

    eBook 문장수집은 웹에서 직접 타이핑 가능하나, 모바일 앱에서 도서를 열람하여 문장을 드래그하시면 직접 타이핑 하실 필요 없이 보다 편하게 남길 수 있습니다.

    P.
    9가지 사례로 익히는 고급 스파크 분석
    현실 세계 빅데이터로 배우는 데이터 과학과 머신러닝
    저자 모두보기
    낭독자 모두보기
    sam 이용권 선택
    님이 보유하신 이용권입니다.
    차감하실 sam이용권을 선택하세요.
    sam 이용권 선택
    님이 보유하신 이용권입니다.
    차감하실 sam이용권을 선택하세요.
    sam 이용권 선택
    님이 보유하신 프리미엄 이용권입니다.
    선물하실 sam이용권을 선택하세요.
    결제완료
    e캐시 원 결제 계속 하시겠습니까?
    교보 e캐시 간편 결제
    sam 열람권 선물하기
    • 보유 권수 / 선물할 권수
      0권 / 1
    • 받는사람 이름
      받는사람 휴대전화
    • 구매한 이용권의 대한 잔여권수를 선물할 수 있습니다.
    • 열람권은 1인당 1권씩 선물 가능합니다.
    • 선물한 열람권이 ‘미등록’ 상태일 경우에만 ‘열람권 선물내역’화면에서 선물취소 가능합니다.
    • 선물한 열람권의 등록유효기간은 14일 입니다.
      (상대방이 기한내에 등록하지 않을 경우 소멸됩니다.)
    • 무제한 이용권일 경우 열람권 선물이 불가합니다.
    이 상품의 총서 전체보기
    네이버 책을 통해서 교보eBook 첫 구매 시
    교보e캐시 지급해 드립니다.
    교보e캐시 1,000원
    • 첫 구매 후 3일 이내 다운로드 시 익일 자동 지급
    • 한 ID당 최초 1회 지급 / sam 이용권 제외
    • 네이버 책을 통해 교보eBook 구매 이력이 없는 회원 대상
    • 교보e캐시 1,000원 지급 (유효기간 지급일로부터 7일)
    구글북액션을 통해서 교보eBook
    첫 구매 시 교보e캐시 지급해 드립니다.
    교보e캐시 1,000원
    • 첫 구매 후 3일 이내 다운로드 시 익일 자동 지급
    • 한 ID당 최초 1회 지급 / sam 이용권 제외
    • 구글북액션을 통해 교보eBook 구매 이력이 없는 회원 대상
    • 교보e캐시 1,000원 지급 (유효기간 지급일로부터 7일)