p.61

01

기계학습의 개념

개념에 대한 적절한 예시 데이터로 그 안에 숨겨진 패턴을 찾아내고,
그것을 바탕으로 새로운 데이터에 대한 지능적인 예측과 판단을 한다.

문제 해결과 탐색, 지식 표현과 추론, 기계학습, 인공 신경망, 딥러닝의 포함 관계

왜 기계학습 기법을 사용하는가?

전통적인 프로그래밍 기계학습
문제 해결 방식 사람이 명시적인 규칙을 프로그램으로 작성 컴퓨터가 데이터의 패턴을 찾아 모델 생성
처리 과정 입력 + 규칙 → 출력 예시 데이터 → 학습 → 예측·판단
알맞은 문제 규칙을 분명하게 표현할 수 있는 문제 정확한 규칙을 미리 표현하기 어려운 문제
학생 성적 평균 계산 동물 이미지의 종 예측

02

p.64

기계학습으로 해결할 수 있는 문제

인간의 경험이 반영된 데이터를 기반으로 최적화된 모델을 만들어 문제를 해결

01

분류·예측

분류: 주어진 데이터를 미리 정의된 여러 그룹 중 하나로 나눈다.
예측: 미래의 값을 추정하거나 알려지지 않은 데이터의 값을 결정한다.

스팸 메일 분류 · 주택 가격 예측
02

군집

비슷한 특성을 가진 데이터를 같은 그룹으로 묶는다.

비슷한 성향의 고객 묶기
03

인식

이미지, 음성, 텍스트를 인식하고 이해한다.

얼굴 감정 · 음성 인식
04

자연어 처리

기계가 인간의 언어를 이해하고 처리한다.

자동 번역 · 감정 추론
05

생성

새로운 데이터나 콘텐츠를 만들어 낸다.

텍스트 · 이미지 · 음성 생성

03

p.65

기계학습을 적용한 다양한 사례

04

p.67

데이터

숫자, 문자, 이미지 등을 관찰하거나 측정하여 수집한 사실이나 값

01

데이터 속성

데이터를 구성하는 구체적인 정보 요소

수치형 데이터

숫자로 표현되는 값

이산형 값 사이가 끊어짐 학생 수, 횟수
연속형 값이 연속적으로 이어짐 시간, 키, 유연성

범주형 데이터

정해진 범주 중 하나에 해당하는 값

성별: 남, 여 혈액형: A, B, AB, O 만족도: 만족, 불만족

02

데이터 유형

데이터가 구성되고 표현되는 형식

정형 데이터

속성이 미리 정해진 행과 열의 표 형태

붓꽃의 꽃받침과 꽃잎 수치가 행과 열로 정리된 표
붓꽃의 속성을 행과 열로 정리

비정형 데이터

속성을 미리 정의하기 어려운 정형화되지 않은 데이터

세 품종의 붓꽃 이미지 데이터
형태가 일정하지 않은 붓꽃 이미지

05

p.69~71

데이터 수집

데이터 수집 방법

1

공공 데이터 수집

국가통계포털 · 공공데이터포털 · 기상자료개방포털
2

민간 데이터 수집

캐글 · AI 허브 · 데이터셋 검색 엔진
3

직접 수집

설문 · 관찰 · 스마트 기기 · 센서

문제 해결에 적합한 데이터 선정 과정

1

문제의 유형 분석

분류 · 예측 · 군집 · 인식 · 자연어 처리 · 생성
2

데이터 유형 탐색

정형 데이터 · 비정형 데이터
3

수집 방법 선택

공공 · 민간 · 직접 수집

데이터 수집·선정 시 고려 사항

충분성과 적합성

문제 해결에 충분한가?

편향성과 공정성

특정 대상에 치우치지 않는가?

개인 정보·저작권

보호 기준과 사용 권리를 지켰는가?

출처와 정당성

검증된 출처에서 수집했는가?

06

p.72

데이터 탐색과 전처리

수집한 데이터가 데이터 살펴보기, 데이터 전처리, 핵심 속성 추출을 거쳐 준비 완료되는 과정

07

p.72~74

데이터 살펴보기

1

확인하기

형태 · 규모 · 유형

데이터의 형태, 개수, 속성, 유형을 확인한다.

df.info()
344개데이터7개속성
2

통계 요약

분포와 값의 범위

개수, 평균, 최솟값, 최댓값 등으로 데이터의 분포를 파악한다.

df.describe()
부리 깊이 평균 17.15체질량 평균 4201.75
3

시각화

패턴 · 관계 · 편향

그래프로 데이터의 패턴, 관계, 편향을 찾는다.

sns.countplot()
Adelie168
Chinstrap68
Gentoo124

Chinstrap 데이터가 적음 → 예측 편향 가능성

08

p.74~76, 80~82

데이터 전처리

데이터 분석에 적합한 상태로 변환하는 과정

1

결측치 처리

값이 비어 있거나 NA, NaN으로 표시된 데이터

df.isnull().sum() df.dropna()
결측치가 있는 행 삭제 344개 → 334개
2

이상치 처리

잘못 입력되었거나 정상적인 값의 범위에서 크게 벗어난 데이터

sns.scatterplot() sns.boxplot()

데이터
경향

교과서의 이상치 포함 여부에 따른 회귀 경향 비교

상자그림
으로
이상치
확인

교과서의 펭귄 종별 체질량 상자그림
3

정규화

MinMaxScaler()

최대-최소 정규화

최솟값과 최댓값 사이의 범위에서 0과 1의 범위로 맞춤

x′ = x − xminxmax − xmin

교과서의 날개 길이와 체질량 최소 최대 정규화 막대그래프

09

p.76~78

핵심 속성

기계학습 모델의 학습 및 예측 성능에 중요한 영향을 미치는 속성

핵심 속성 추출 방법

  1. 1

    불필요한 속성 검토/제거

  2. 2

    공정성에 문제 되는 속성 검토

  3. 3

    중복되는 속성이 없는지 분석

  4. 4

    주어진 속성의 중요도 판별

  5. 5

    더 필요한 속성이 없는지 검토/추가

정형 데이터

sns.scatterplot()교과서의 펭귄 부리 길이와 부리 깊이 산점도
sns.regplot()교과서의 펭귄 부리 길이와 체질량 회귀 산점도
sns.heatmap()교과서의 펭귄 속성 상관계수 히트맵

비정형 데이터

교과서의 아기 울음소리, 클래식 음악, 재채기, 코 푸는 소리, 기침 소리 파형