데이터 수집 과정에서 클래스 불균형을 줄이려면 정상·비정상·희귀 클래스의 목표 수량과 조건을 미리 설계해야 합니다. 불균형이 심하면 모델이 다수 클래스에만 맞춰 학습할 수 있습니다.
프롬데이터 관점에서는 이 질문을 클래스 불균형 데이터 수집의 단일 개념으로만 보지 않고, 수집·라벨링·가공·품질검수까지 이어지는 AI 데이터 구축 흐름 안에서 판단합니다.
실무 기준
- 클래스별 목표 수량과 우선순위를 정합니다.
- 부족 클래스는 별도 타깃 수집을 진행합니다.
- 수집이 어려운 케이스는 합성데이터나 데이터 증강을 검토합니다.
제조 불량, 산업재해, 의료 희귀 질환처럼 발생 빈도가 낮은 데이터는 자연 수집만으로 충분한 수량 확보가 어렵습니다. 이런 경우에는 기획 수집과 합성 데이터 생성 및 구축을 함께 고려합니다.
구축 시 주의할 점
- 정상 데이터가 많아도 희귀 위험 클래스가 부족하면 모델은 위험을 놓칠 수 있습니다.
- 균형을 맞추기 위해 품질 낮은 데이터를 무리하게 넣는 것도 피해야 합니다.
관련 서비스 내부링크
이 주제와 직접 연결되는 서비스는 AI 데이터 수집, 합성 데이터 생성 및 구축, AI 데이터 품질관리입니다.
상담이 필요한 경우 문의하기에서 프로젝트 조건을 남겨주세요.
