Name: 자바 데이터 사이언스 쿡북
Rating: 10 (1 reviews)

책소개

실무에 적합한 데이터 분석 모델을 구축할 때, 자바(Java)가 도움이 될 수 있다. MLlib, Weka, DL4j 등과 같은 강력한 라이브러리를 사용하면 필요한 모든 데이터 과학 작업을 효율적으로 수행할 수 있다. 이 책은 다양한 데이터 과학 관련 문제를 해결하기 위한 방법을 제공한다. 먼저, 데이터를 수집하고 정리하고 인덱스를 생성해 검색하는 데 도움이 되는 방법부터 시작한다. 그리고 데이터에서 정보를 분석 및 학습하는 다양한 기술을 배우게 된다. 또한 대용량 데이터를 처리하고, 머신 러닝과 딥러닝을 적용하고, 데이터를 시각화하는 방법을 배울 수 있다.

출판사 서평

★ 이 책에서 다루는 내용 ★

■ 데이터 정제 및 전처리 방법
■ 정보 추출과 데이터 변환에 필요한 최신 머신 러닝 기법
■ 대용량의 데이터 저장 및 검색 방법
■ 텍스트 형식인 빅데이터에서의 정보 추출 기술
■ 빅데이터와 딥러닝에 필요한 기본 기술 향상
■ 데이터 시각화 기술을 통해 얻는 가치 있는 인사이트
■ 단계적 학습을 통해 업계 표준적인 실제 데이터 프로덕션 환경에 대한 실력 향상

★ 이 책의 대상 독자 ★

자바로 데이터 과학과 관련된 실제 문제를 해결하고자 하는 모든 독자를 대상으로 한다. 매우 포괄적인 내용을 다루고 있기 때문에 데이터 과학 분야의 프로젝트 문제를 자바로 해결하고 싶은 실무자들에게도 매우 유용할 것이다.

★ 이 책의 구성 ★

1장, '데이터 수집과 정제'에서는 데이터를 읽고 쓰는 다양한 방법과 함께 데이터에서 노이즈를 제거해 정제하는 법을 다룬다. 또한 PDF, ASCII, CSV, TSV, XML, JSON과 같은 다양한 파일 형식에서 데이터를 읽는 법도 배운다. 웹 데이터를 추출하는 방법도 소개할 것이다.
2장, '데이터 인덱싱과 검색 빠른'에서는 검색을 위해 데이터를 인덱싱하는 방법을 아파치 루씬(Apache Lucene)을 사용해 학습한다. 여기서 설명하는 기술은 현대 검색 기술의 기초가 될 것이다.
3장, '데이터의 통계적 분석'에서는 데이터에서 통계 정보를 수집하고 분석하기 위해 아파치 Math API를 사용한다. 또한 분석 결과를 벤치마크와 비교하는 표준 도구인 통계적 유의성 검정과 같은 개념도 다룰 것이다.
4장, '데이터로부터 학습하기-1부'에서는 웨카(Weka) 머신 러닝 워크벤치를 이용해 분류(classification), 군집화(clustering), 피쳐 선택(feature selection) 등을 연습해본다.
5장, '데이터로부터 학습하기-2부'에서는 자바 머신 러닝(Java-ML)이라는 또 다른 라이브러리를 사용해 데이터 가져오기 및 내보내기, 분류, 피쳐 선택 작업을 해본다. 스탠포드 분류기(Stanford Classifier)와 Massive Online Analysis(MOA)를 이용한 기초적인 분류도 다룬다.
6장, '텍스트 데이터에서 정보 추출하기'에서는 텍스트 데이터로부터 정보를 추출하기 위해 응용되는 데이터 과학 도구들을 학습한다. 여기서는 코어 자바뿐만 아니라 정보 추출 및 검색 작업에 머신 러닝을 적용하는 OpenNLP, 스탠포드 CoreNLP, 맬릿(Mallet), 웨카 등의 유명한 라이브러리도 다룬다.
7장, '빅데이터 다루기'에서는 아파치 머하웃(Apache Mahout)과 스파크(Spark) MLib 같은 머신 러닝을 위한 빅데이터 플랫폼을 살펴본다.
8장, '데이터를 깊이 있게 학습하기'에서는 자바를 위한 딥러닝 라이브러리인 DL4j를 사용해 딥러닝 기초를 학습할 것이다. word2vec 알고리즘, 딥 빌리프 네트워크(deep belief networks), 오토 인코더(autoencoder) 등도 함께 다룬다.
9장, '데이터 시각화'에서는 데이터를 기반으로 정보를 시각적으로 표현하는 GRAL 패키지를 학습한다. 수많은 기능 중에 핵심적이고 기본적인 플롯(plot) 기능을 주로 다룰 것이다

★ 옮긴이의 말 ★

데이터 과학자들이 일상적으로 하는 업무들을 자바를 통해 수행할 수 있도록 가이드하는 책이다. 다양한 작업을 단계별로 따라가면서 배울 수 있도록 구성돼 있다. 먼저, 데이터를 분석하기 전에 가장 많은 시간이 소요되는 데이터 수집과 전처리를 학습한다. 다음으로 아파치 루씬을 사용하여 데이터를 인덱싱하고 검색하는 방법을 다루며, 통계적인 관점에서 데이터를 분석할 수 있는 여러 가지 자바 도구를 소개하고 있다. 그리고 요즘 크게 주목받는 머신 러닝과 딥러닝의 다양한 기법을 학습한다. 또한 비정형 분석의 핵심이라고 할 수 있는 텍스트 분석도 빼놓지 않고 다루고 있다. 자바를 아파치 스파크와 연동하여 빅데이터를 처리하는 방법도 배울 수 있다. 마지막으로 분석한 데이터를 다양한 플롯을 통해 시각화하는 방법도 소개한다. 이 책은 자바로 할 수 있는 데이터 과학의 수많은 과정을 폭넓게 그리고 친절하게 설명하고 있다. 데이터 과학에 관심 있는 자바 사용자가 입문서로 활용하기 좋은 책이다.

1장. 데이터 수집과 정제
__서론
__자바를 사용해 하위 디렉터리의 모든 파일명 가져오기
__Apache Commons IO를 사용해 하위 디렉터리의 모든 파일명 가져오기
__자바8을 사용해 텍스트 파일 내용 한 번에 읽기
__Apache Commons IO를 사용해 텍스트 파일 내용 한 번에 읽기
__Apache Tika로 PDF에서 텍스트 추출
__정규 표현식으로 ASCII 텍스트 파일 정제
__Univocity를 사용해 CSV 파일 파싱
__Univocity를 사용해 TSV 파일 파싱
__JDOM으로 XML 파일 파싱
__JSONsimple을 사용해 JSON 파일 쓰기
__JSONsimple을 사용해 JSON 파일 읽기
__JSoup을 사용해 URL로부터 웹 데이터 추출
__셀레늄 웹드라이버를 사용해 웹사이트에서 웹 데이터 추출
__MySQL 데이터베이스에서 테이블 데이터 읽기

2장. 데이터 인덱싱과 검색
__서론
__아파치 루씬으로 데이터 인덱싱
__아파치 루씬으로 인덱싱된 데이터 검색

3장. 데이터의 통계적 분석
__서론
__기술 통계량 생성
__요약 통계량 생성
__여러 개의 분포로부터 요약 통계량 생성하기
__빈도 분포 계산
__문자열에서 단어 빈도 계산
__자바8을 사용해 문자열의 단어 빈도 계산
__단순 회귀
__최소 자승 회귀
__일반화 최소 자승 회귀
__두 데이터셋의 공분산 계산
__두 데이터셋의 피어슨 상관계수 계산
__쌍체 표본 t-테스트
__카이 제곱 테스트
__일원 분산 분석
__콜모고로프-스미르노프 테스트

4장. 데이터로부터 학습하기 - 1부
__서론
__ARFF 파일 생성 및 저장
__머신 러닝 모델의 교차 검증
__테스트 데이터 분류
__필터링된 속성으로 테스트 데이터 분류
__선형 회귀 모델
__로지스틱 회귀 모델
__KMeans 알고리즘으로 데이터 군집화
__클래스를 가진 데이터 군집화
__데이터로부터 연관 규칙 학습
__저수준 방법, 필터링 방법, 메타 분류기를 이용한 피쳐/속성 선택

5장. 데이터로부터 학습하기 - 2부
__서론
__Java-ML 라이브러리를 사용해 데이터에 대한 머신 러닝 수행
__스탠포드 분류기를 이용한 데이터 분류
__MOA를 이용한 데이터 분류
__뮬란을 이용한 데이터 분류

__6장. 텍스트 데이터에서 정보 추출하기
__서론
__자바를 이용한 토큰 추출
__자바를 이용한 문장 추출
__OpenNLP를 이용한 토큰과 문장 추출
__스탠포드 CoreNLP를 이용한 단어의 기본형과 품사 추출, 개체명 인식
__자바를 사용해 코사인 유사도 기준으로 텍스트 유사도 측정
__맬릿을 이용해 텍스트 문서에서 토픽 추출
__맬릿을 이용한 텍스트 문서 분류
__웨카를 이용한 텍스트 문서 분류

7장. 빅데이터 다루기
__서론
__아파치 머하웃을 이용한 온라인 로지스틱 회귀 모델 학습
__아파치 머하웃을 이용한 온라인 로지스틱 회귀 모델 적용
__아파치 스파크를 이용한 단순 텍스트 마이닝 문제 해결
__MLib으로 KMeans 군집화 수행
__MLib으로 선형 회귀 모델 생성
__MLib에서 랜덤 포레스트 모델로 데이터 포인트 분류

8장. 데이터를 깊이 있게 학습하기(딥러닝)
__서론
__DL4j를 이용한 word2vec 신경망 구현
__DL4j를 이용한 DBN 신경망 구현
__DL4j를 이용한 오토인코더 구현

9장. 데이터 시각화
__서론
__2D 사인 그래프 그리기
__히스토그램 그리기
__막대 차트 그리기
__상자 수염 플롯 그리기
__산점도 그리기
__도넛 플롯 그리기
__영역 그래프 그리기

저자소개

루시디 샴스 [저] 신작알림 SMS신청

생년월일	-

해당작가에 대한 소개가 없습니다.

김우현 [역] 신작알림 SMS신청

생년월일	-

대학생 시절, 선배와 함께 창업한 후 20년 넘게 소프트웨어 개발자로 살고 있으며 인공지능 분야에서 새로운 길을 만들어가고 있다. 숙명여자대학교 나노/바이오 전산화학 연구센터에서 데이터 과학자로 근무했으며, 현재 프리랜서 AI 개발자로 일하고 있다. 옮긴 책으로는 『R 데이터 구조와 알고리즘』(에이콘, 2017), 『자바 데이터 사이언스 쿡북』(에이콘, 2018), 『피처 엔지니어링, 제대로 시작하기』(에이콘, 2018), 『The Python 3 Standard Library by Example』(에이콘, 2020) 등이 있다.

역자의 다른책

전체보기

북카트담기

파이썬을 활용한 머신러닝 해석 가능성

45,000원 40,500원
북카트담기

파이썬 객체지향 프로그래밍

43,000원 38,700원
북카트담기

R 데이터 구조와 알고리즘

30,000원 27,000원

주간랭킹
더보기

상품정보제공고시

판매자정보

인터파크도서에 등록된 오픈마켓 상품은 그 내용과 책임이 모두 판매자에게 있으며, 인터파크도서는 해당 상품과 내용에 대해 책임지지 않습니다.

상호	(주)교보문고
대표자명	안병현
사업자등록번호	102-81-11670
연락처	1544-1900
전자우편주소	callcenter@kyobobook.co.kr
통신판매업신고번호	01-0653
영업소재지	서울특별시 종로구 종로 1(종로1가,교보빌딩)

교환/환불

반품/교환 방법	‘마이페이지 > 취소/반품/교환/환불’ 에서 신청 또는 1:1 문의 게시판 및 고객센터(1577-2555)에서 신청 가능
반품/교환가능 기간	변심 반품의 경우 출고완료 후 6일(영업일 기준) 이내까지만 가능 단, 상품의 결함 및 계약내용과 다를 경우 문제점 발견 후 30일 이내
반품/교환 비용	변심 혹은 구매착오로 인한 반품/교환은 반송료 고객 부담 상품이나 서비스 자체의 하자로 인한 교환/반품은 반송료 판매자 부담
반품/교환 불가 사유	·소비자의 책임 있는 사유로 상품 등이 손실 또는 훼손된 경우 (단지 확인을 위한 포장 훼손은 제외) ·소비자의 사용, 포장 개봉에 의해 상품 등의 가치가 현저히 감소한 경우 예) 화장품, 식품, 가전제품(악세서리 포함) 등 ·복제가 가능한 상품 등의 포장을 훼손한 경우 예) 음반/DVD/비디오, 소프트웨어, 만화책, 잡지, 영상 화보집 ·시간의 경과에 의해 재판매가 곤란한 정도로 가치가 현저히 감소한 경우 ·전자상거래 등에서의 소비자보호에 관한 법률이 정하는 소비자 청약철회 제한 내용에 해당되는 경우
상품 품절	공급사(출판사) 재고 사정에 의해 품절/지연될 수 있음
소비자 피해보상 환불지연에 따른 배상	·상품의 불량에 의한 교환, A/S, 환불, 품질보증 및 피해보상 등에 관한 사항은소비자분쟁해결 기준 (공정거래위원회 고시)에 준하여 처리됨 ·대금 환불 및 환불지연에 따른 배상금 지급 조건, 절차 등은 전자상거래 등에서의소비자 보호에 관한 법률에 따라 처리함

(주)KG이니시스 구매안전서비스

(주)인터파크커머스는 회원님들의 안전거래를 위해 구매금액, 결제수단에 상관없이 (주)인터파크커머스를 통한 모든 거래에 대하여
(주)KG이니시스가 제공하는 구매안전서비스를 적용하고 있습니다.

배송안내

교보문고 상품은 택배로 배송되며, 출고완료 1~2일내 상품을 받아 보실 수 있습니다.
출고가능 시간이 서로 다른 상품을 함께 주문할 경우 출고가능 시간이 가장 긴 상품을 기준으로 배송됩니다.
군부대, 교도소 등 특정기관은 우체국 택배만 배송가능합니다.
배송비는 업체 배송비 정책에 따릅니다.

- 도서 구매 시 15,000원 이상 무료배송, 15,000원 미만 2,500원

- 상품별 배송비가 있는 경우, 상품별 배송비 정책 적용

인터파크 롯데카드	5% (25,650원) (최대할인 10만원 / 전월실적 40만원)
북피니언 롯데카드	30% (18,900원) (최대할인 3만원 / 3만원 이상 결제)
NH쇼핑&인터파크카드	20% (21,600원) (최대할인 4만원 / 2만원 이상 결제)

신한	2~3개월(5만원↑) ※5만원 이상 결제 시 (단, 법인/체크/기업/선불카드/BC 계열 제외)
비씨	2~3개월(5만원↑) ※5만원 이상 결제 시 (단, 법인/체크/기업/선불/Non-BC카드 제외)
국민	2~3개월(5만원↑) ※5만원 이상 결제 시 (단, 법인/체크/기업/선불카드/BC 계열 제외)
삼성	2~5개월(5만원↑) ※5만원 이상 결제 시 (단, 법인/체크/기업/선불카드 제외)
현대	2~3개월(1만원↑) ※1만원 이상 결제 시 (단, 법인/체크/기업/선불카드 제외)
롯데	2~3개월(5만원↑) ※5만원 이상 결제 시 (단, 법인/체크/기업/선불카드/BC 계열 제외)
하나SK	2~3개월(5만원↑) ※5만원 이상 결제 시 (단, 법인/체크/기업/선불카드/BC 계열 제외)

할인혜택	카드할인/무이자 할부 이달의 혜택 도서상품권
적립혜택	1,500P (5%적립) 5만원이상 주문시 2천P+등급별 최대 1.5%적립
	S-Point 적립은 마이페이지에서 직접 구매확정하신 경우만 적립 됩니다.
추가혜택

배송정보	5/14(화) 이내 발송 예정 (서울시 강남구 삼성로 512) 무료배송
주문수량	감소증가 감소 증가

추가 적립 안내

자바 데이터 사이언스 쿡북 : Weka, MLlib, DL4j로 즐기는 머신 러닝 & 딥러닝

이상품의 분류

책소개

출판사 서평

목차

저자소개

주간랭킹
더보기

상품정보제공고시

이벤트 기획전

이 책과 연관있는 항공권

리뷰

10.0 (총 0건)

리뷰쓰기

100자평

작성시 유의사항

100자평

0.0

(총 0건)

최근순

평점 높은순

판매자정보

교환/환불

(주)KG이니시스 구매안전서비스

배송안내

파워링크 광고

추가 적립 안내

자바 데이터 사이언스 쿡북 : Weka, MLlib, DL4j로 즐기는 머신 러닝 & 딥러닝

이상품의 분류

책소개

출판사 서평

목차

저자소개

주간랭킹 더보기

상품정보제공고시

이벤트 기획전

이 책과 연관있는 항공권

리뷰 10.0 (총 0건) 리뷰쓰기

100자평 작성시 유의사항

100자평 0.0 (총 0건) 최근순 평점 높은순

판매자정보

교환/환불

(주)KG이니시스 구매안전서비스

배송안내

파워링크 광고

주간랭킹
더보기

리뷰

10.0 (총 0건)

리뷰쓰기

100자평

작성시 유의사항

100자평

0.0

(총 0건)

최근순

평점 높은순