왜 기계학습 기법을 사용하는가?
| 전통적인 프로그래밍 | 기계학습 | |
|---|---|---|
| 문제 해결 방식 | 사람이 명시적인 규칙을 프로그램으로 작성 | 컴퓨터가 데이터의 패턴을 찾아 모델 생성 |
| 처리 과정 | 입력 + 규칙 → 출력 | 예시 데이터 → 학습 → 예측·판단 |
| 알맞은 문제 | 규칙을 분명하게 표현할 수 있는 문제 | 정확한 규칙을 미리 표현하기 어려운 문제 |
| 예 | 학생 성적 평균 계산 | 동물 이미지의 종 예측 |
p.61
01
개념에 대한 적절한 예시 데이터로 그 안에 숨겨진 패턴을 찾아내고,
그것을 바탕으로 새로운 데이터에 대한 지능적인 예측과 판단을 한다.
| 전통적인 프로그래밍 | 기계학습 | |
|---|---|---|
| 문제 해결 방식 | 사람이 명시적인 규칙을 프로그램으로 작성 | 컴퓨터가 데이터의 패턴을 찾아 모델 생성 |
| 처리 과정 | 입력 + 규칙 → 출력 | 예시 데이터 → 학습 → 예측·판단 |
| 알맞은 문제 | 규칙을 분명하게 표현할 수 있는 문제 | 정확한 규칙을 미리 표현하기 어려운 문제 |
| 예 | 학생 성적 평균 계산 | 동물 이미지의 종 예측 |
02
p.64
인간의 경험이 반영된 데이터를 기반으로 최적화된 모델을 만들어 문제를 해결
분류: 주어진 데이터를 미리 정의된 여러 그룹 중 하나로 나눈다.
예측: 미래의 값을 추정하거나 알려지지 않은 데이터의 값을 결정한다.
비슷한 특성을 가진 데이터를 같은 그룹으로 묶는다.
비슷한 성향의 고객 묶기이미지, 음성, 텍스트를 인식하고 이해한다.
얼굴 감정 · 음성 인식기계가 인간의 언어를 이해하고 처리한다.
자동 번역 · 감정 추론새로운 데이터나 콘텐츠를 만들어 낸다.
텍스트 · 이미지 · 음성 생성03
p.65
선호할 콘텐츠·제품 추천
사물·얼굴·장면 인식 및 분류
새로운 문장 번역
질병 특성 탐지 및 진단
신용 점수·가격 변동 예측
병충해·물 부족 탐지 및 예측
04
p.67
숫자, 문자, 이미지 등을 관찰하거나 측정하여 수집한 사실이나 값
01
데이터를 구성하는 구체적인 정보 요소
숫자로 표현되는 값
정해진 범주 중 하나에 해당하는 값
02
데이터가 구성되고 표현되는 형식
속성이 미리 정해진 행과 열의 표 형태
속성을 미리 정의하기 어려운 정형화되지 않은 데이터
05
p.69~71
문제 해결에 충분한가?
특정 대상에 치우치지 않는가?
보호 기준과 사용 권리를 지켰는가?
검증된 출처에서 수집했는가?
06
p.72
07
p.72~74
형태 · 규모 · 유형
데이터의 형태, 개수, 속성, 유형을 확인한다.
df.info()
분포와 값의 범위
개수, 평균, 최솟값, 최댓값 등으로 데이터의 분포를 파악한다.
df.describe()
패턴 · 관계 · 편향
그래프로 데이터의 패턴, 관계, 편향을 찾는다.
sns.countplot()
Chinstrap 데이터가 적음 → 예측 편향 가능성
08
p.74~76, 80~82
데이터 분석에 적합한 상태로 변환하는 과정
값이 비어 있거나 NA, NaN으로 표시된 데이터
df.isnull().sum()
df.dropna()
잘못 입력되었거나 정상적인 값의 범위에서 크게 벗어난 데이터
sns.scatterplot()
sns.boxplot()


MinMaxScaler()
최솟값과 최댓값 사이의 범위에서 0과 1의 범위로 맞춤
x′ = x − xminxmax − xmin

09
p.76~78
기계학습 모델의 학습 및 예측 성능에 중요한 영향을 미치는 속성
불필요한 속성 검토/제거
공정성에 문제 되는 속성 검토
중복되는 속성이 없는지 분석
주어진 속성의 중요도 판별
더 필요한 속성이 없는지 검토/추가
sns.scatterplot()
sns.regplot()
sns.heatmap()

1 / 1