중복 데이터는 AI 모델 성능을 떨어뜨릴 수 있습니다. 같은 장면이나 문장이 과도하게 반복되면 모델이 특정 조건에 과적합되고, 실제 다양한 상황에 대한 일반화 성능이 약해질 수 있습니다.
프롬데이터 관점에서는 이 질문을 중복 데이터의 단일 개념으로만 보지 않고, 데이터 수집·라벨링·가공·품질검수까지 이어지는 AI 데이터 구축 흐름 안에서 판단합니다.
실무 기준
- 완전 중복과 유사 중복을 구분해 점검합니다.
- 동일 장면의 연속 프레임을 데이터 분할 기준에 맞게 관리합니다.
- 중복 제거 후 클래스 분포가 무너지지 않는지 확인합니다.
데이터셋 품질검수에서는 수량뿐 아니라 유효 데이터 비율이 중요합니다. 중복을 줄이면 모델이 더 다양한 장면과 조건을 학습할 수 있습니다.
구축 시 주의할 점
- 중복 제거가 과하면 희귀 클래스까지 삭제될 수 있습니다.
- 중복 기준은 데이터 유형별로 다르게 설계해야 합니다.
관련 서비스 내부링크
이 주제와 직접 연결되는 서비스는 AI 데이터 가공, AI 데이터 품질관리, 3단계 품질 보증 프로세스입니다.
상담이 필요한 경우 문의하기에서 프로젝트 조건을 남겨주세요.
