원천 데이터는 아직 AI가 학습하기 전 단계의 이미지, 영상, 텍스트, 음성, 문서 파일입니다. 라벨 데이터는 그 원천 데이터에 객체 위치, 클래스, 문장 의미, 감정, 행동 상태 같은 정답 정보를 부여한 데이터입니다.
프롬데이터 관점에서는 이 질문을 원천 데이터 라벨 데이터의 단일 개념으로만 보지 않고, 수집·라벨링·가공·품질검수까지 이어지는 AI 데이터 구축 흐름 안에서 판단합니다.
실무 기준
- 원천 데이터는 수집 품질과 활용 권한을 확인합니다.
- 라벨 데이터는 정답 기준과 포맷 일치 여부를 확인합니다.
- 가공 데이터는 모델 학습에 맞게 정제·구조화된 상태인지 확인합니다.
예를 들어 제조 현장 이미지가 원천 데이터라면, 이미지 안의 결함 위치를 바운딩 박스나 세그멘테이션으로 표시한 결과가 라벨 데이터입니다. 원천 데이터가 좋아도 라벨 기준이 부정확하면 모델은 잘못된 정답을 학습합니다.
구축 시 주의할 점
- 원천 데이터와 라벨 파일의 매칭 관계가 깨지면 전체 데이터셋 신뢰도가 떨어집니다.
- 파일명, 폴더 구조, 메타데이터를 함께 관리해야 추적이 가능합니다.
관련 서비스 내부링크
이 주제와 직접 연결되는 서비스는 AI 데이터 수집, AI 데이터 라벨링, AI 데이터 가공입니다.
상담이 필요한 경우 문의하기에서 프로젝트 조건을 남겨주세요.
