학습용·검증용·테스트용 데이터는 AI 모델을 학습시키고, 중간 성능을 조정하고, 최종 성능을 객관적으로 확인하기 위해 분리합니다. 핵심은 단순 비율보다 데이터 누수를 막는 것입니다.
프롬데이터 관점에서는 이 질문을 학습 검증 테스트 데이터의 단일 개념으로만 보지 않고, 수집·라벨링·가공·품질검수까지 이어지는 AI 데이터 구축 흐름 안에서 판단합니다.
실무 기준
- 동일 인물·장소·제품이 여러 세트에 중복되지 않도록 관리합니다.
- 클래스별 분포가 특정 세트에 치우치지 않게 나눕니다.
- 최종 테스트 데이터는 학습 과정에 사용하지 않습니다.
일반적으로 7:2:1 또는 8:1:1 비율이 사용될 수 있지만, 실제 기준은 프로젝트 성격에 따라 달라집니다. 제조 결함처럼 희귀 클래스가 있는 경우에는 비율보다 클래스 균형과 대표성이 더 중요합니다.
구축 시 주의할 점
- 동일 장면의 연속 프레임을 서로 다른 세트에 나누면 과대평가가 발생할 수 있습니다.
- 검증용 데이터로 반복 튜닝한 뒤 다시 성능을 주장하면 객관성이 약해집니다.
관련 서비스 내부링크
이 주제와 직접 연결되는 서비스는 AI 학습 데이터, AI 데이터 가공, AI 데이터 품질관리입니다.
상담이 필요한 경우 문의하기에서 프로젝트 조건을 남겨주세요.
