잡아라! 텍스트 마이닝 with 파이썬: 지금 바로 할 수 있는 데이터 추출과 분석

단행본

잡아라! 텍스트 마이닝 with 파이썬: 지금 바로 할 수 있는 데이터 추출과 분석

개인저자: 서대호 지음
발행사항: 서울 : BJpublic(비제이퍼블릭), 2019
형태사항: 203 p. : 삽화, 도표 ; 23 cm
ISBN: 9791186697788
청구기호: 005.76 서222ㅈ
일반주기: 색인수록
주제: 텍스트 마이닝[text mining], 파이썬[Python]

소장정보

위치	등록번호	청구기호 / 출력	상태	반납예정일
이용 가능 (1)
1자료실	00017982		대출가능	-

이용 가능 (1)

등록번호
00017982
상태/반납예정일
대출가능
-
위치/청구기호(출력)
1자료실

책 소개

파이썬을 이용한 텍스트 마이닝으로
'아' 다르고 '어' 다른 한글 텍스트 분석하기

알고리즘에 대한 수학적인 이해가 없어도 개념 파악을 도와주며 독자들이 코드를 따라하면서 결과를 바로바로 확인할 수 있도록 구성했다. 또한 텍스트 데이터 추출을 위해 필수적인 웹 크롤링 기술도 익힌다. 따라서 독자들은 어떠한 웹페이지라도 이 책의 내용을 응용하여 스스로 데이터를 추출 할 수 있다. 이 책을 본 이후에는 데이터 수집부터 분석까지 전 과정을 스스로 할 수 있다.

텍스트 마이닝 분야는 공학자들 이외에 인문, 사회, 예체능 학생들 및 기업에서도 논문, 마케팅을 위해 쓸 수 있다. 세상 속에 존재하는 전체 데이터의 90% 이상이 비정형 텍스트 데이터로 이루어져 있다. 특히 각종 웹 페이지, sns 등에서 엄청난 양의 비정형 텍스트 데이터가 쏟아져 나오고 있다. 이러한 비정형 텍스트 데이터를 잘 활용한다면 연구, 기업 경영 전략에 매우 유익하게 활용될 수 있으며 이를 위해서는 텍스트 마이닝 기술이 필수적이다.

이 책의 특징
- 입문자를 위한 기초 수준의 파이썬 기본 문법들을 소개한다.
- 파이썬을 이용한 텍스트 마이닝 방법들의 예제를 소개한다.
- 텍스트 마이닝과 함께 사용할 웹 크롤링 기법을 소개한다.

이 책이 필요한 독자
- 텍스트 마이닝을 이용하여 논문을 쓰려는 분
- 웹에서 발생하는 텍스트 정보를 활용하여 기업 마케팅 및 인사이트 도출을 원하는 분
- 텍스트 마이닝을 공부하고 싶은 분

독자대상
초중급

우리는 데이터의 홍수 속에서 살아가고 있지만 넘치는 데이터를 전부 받아들이고 분석을 할 수 없을 것이다. 데이터를 분석하기 위해서 그만큼 엄청난 인건비와 시간이 소요되기 때문이다. 데이터의 종류는 많지만, 우리가 가장 많이 보고 접하는 데이터는 역시 텍스트 데이터이다. 따라서 텍스트 데이터 분석이 가장 필요할 것이다..

이 책은 공학도가 아닌 독자에게도 유용할 것이다. 가장 인기 있는 프로그래밍 언어 중 하나인 파이썬을 이용해 텍스트 데이터 수집을 위한 크롤링을 넘어 분석까지 스스로 할 수 있도록 도와주면서 파이썬과 텍스트 마이닝의 기초를 배우게 될 것이다.

1. 텍스트 마이닝이란?
1.1. 문서 수집
1.2. 문서 특징

2. 데이터 사전 처리를 위한 기초 파이썬 코딩
2.1. 아나콘다 설치
2.2. 주피터 노트북
2.3. pandas 라이브러리
2.4. numpy 라이브러리

3.텍스트 데이터
3.1. 정규 표현식
3.2. 사전 처리
3.3. 품사 분석

4. 텍스트 마이닝 기법
4.1. 단어 빈도분석 - 기본적인 통계정보를 알아보자!
4.2. 군집 분석 - 유사한 문서들을 모아보자!
4.3. 토픽 모델링 - 토픽 모델링을 이용하여 문서의 토픽을 추론하자!
4.4. 감성 분석 - 텍스트의 감성 정도를 지표로 나타내자!
4.5. 연관어 분석

5. 텍스트 크롤링
5.1. Beautifulsoup을 이용한 크롤링
5.2. 셀레니움을 이용한 크롤링
5.3. lxml을 이용한 크롤링

6. 실전: 트위터 메시지 분석

7. 실전: 소셜커머스 후기 분석

저자 소개

저자 서대호

한양대 정보시스템학과를 졸업하고 한양대 산업공학과에서 석사 학위를 받았다. 이후 한국과학기술원, 모비젠, 한국전자기술연구원에서 연구원으로 일했으며 연세대학교 정보대학원 박사과정을 수료했다. 현재 AI 기업 다겸(주)의 대표이사로 재직하고 있다. 4차 산업 기술 관련한 도서 및 자기계발 서적을 다수 집필하였고 칼럼니스트로도 활동 중이다.
급변하는 세계정세에 대응해 스스로 자본을 지키기 위해서는 화폐경제의 역사적 흐름과 블록체인 기술을 활용한 비트코인에 대해 필수적으로 알아야 한다. 아직까지도 많은 이들이 비트코인 투자를 도박처럼 여...

작가의 다른 작품

알라딘에서 제공한 저자 정보입니다.상세보기