모델 데이터
특성
Feature
뜻
모델이 예측하거나 패턴을 찾을 때 사용하는 입력 변수입니다.
언제 쓰나
예측 시점에 사용할 수 있고 작업과 관련된 특성을 선택합니다.
활용 예시
기능: tenure_days, order_count_90d, support_ticket_count.데이터 분석
특성, 타깃, 학습 방식, 데이터 분할, 파이프라인, 적합 문제, 교차 검증, 평가 지표, 누출 위험의 핵심 용어를 설명합니다.
12 개 용어
모델 데이터
Feature
모델이 예측하거나 패턴을 찾을 때 사용하는 입력 변수입니다.
예측 시점에 사용할 수 있고 작업과 관련된 특성을 선택합니다.
기능: tenure_days, order_count_90d, support_ticket_count.모델 데이터
Target
지도학습 모델이 예측하도록 학습하는 결과값 또는 라벨입니다.
관측 기간과 업무 의미가 분명하도록 정의합니다.
대상: 고객이 다음 30일 이내에 이탈할 가능성.학습 방식
Supervised learning
라벨이 있는 예시를 이용해 입력과 정답의 관계를 학습하는 방식입니다.
과거 라벨이 있는 분류나 회귀 문제에 사용합니다.
사기 또는 사기가 아닌 거래로 레이블이 지정된 과거 거래를 사용하여 분류기를 훈련합니다.학습 방식
Unsupervised learning
정답 라벨 없이 데이터 안의 구조를 찾는 학습 방식입니다.
군집화, 차원 축소, 이상 탐색에 사용합니다.
판매 혼합 및 고객 행동에 따라 스토어를 클러스터링합니다.유효성 검사
Train-test split
모델 학습에 사용하는 데이터와 최종 평가용 데이터를 분리하는 방식입니다.
무작위 분할이 정보를 누출할 수 있으면 시간·그룹을 고려해 분할합니다.
1월부터 10월까지 훈련하고, 11월에 검증하고, 12월에 테스트합니다.워크플로
Preprocessing pipeline
변환과 모델 학습 단계를 정해진 순서로 재사용하는 과정입니다.
전처리는 학습 데이터로만 맞추고 예측 시 동일하게 적용합니다.
impute -> standardize -> one-hot encode -> fit model학습 방식
Model
예측이나 의사결정을 위해 학습된 수학적 또는 계산적 표현입니다.
동일한 평가 방식으로 단순 기준 모델과 복잡한 후보를 비교합니다.
기본: 로지스틱 회귀; 후보: 그래디언트 부스팅.유효성 검사
Overfitting
모델이 학습 데이터의 잡음까지 익혀 새로운 데이터에서 성능이 떨어지는 현상입니다.
별도 평가 데이터로 확인하고 모델 단순화, 규제, 대표 데이터로 줄입니다.
정확도 99%, 검증 정확도 71%는 과적합을 나타냅니다.유효성 검사
Underfitting
모델이 너무 단순해 데이터의 중요한 패턴을 포착하지 못하는 현상입니다.
학습과 검증 성능이 모두 낮은지 확인합니다.
오류가 지속적으로 높은 경우, 더 유용한 기능이나 더 적합한 모델을 추가합니다.유효성 검사
Cross-validation
데이터를 여러 학습·검증 폴드로 반복 분할해 모델 성능을 추정하는 방법입니다.
클래스 비율, 그룹, 시간 순서에 맞는 분할 방식을 선택합니다.
불균형 분류 작업에 대해 5-fold 교차 검증을 수행합니다.유효성 검사
Evaluation metric
예측 품질을 판단하는 수치형 기준입니다.
편의가 아니라 오류 비용과 클래스 불균형을 고려해 선택합니다.
거짓 양성과 거짓 음성이 서로 다른 비용을 가질 때 정밀도와 재현율을 추적합니다.위험
Data leakage
실제 예측 시점에는 사용할 수 없는 정보가 학습에 들어가는 문제입니다.
결과를 신뢰하기 전에 특성, 분할 시점, 전처리, 집계 기간을 점검합니다.
데이터 누출은 오프라인 점수를 비정상적으로 높이고 실제 운영 성능을 떨어뜨릴 수 있습니다.
주문이 환불될지 예측하기 위해 최종 환불 상태를 사용하지 마십시오.