납품 포맷
납품 포맷은 원천 데이터, 라벨 파일, 메타데이터, 품질 리포트가 고객사의 학습 파이프라인에 맞게 전달되는 구조를 말합니다.
AI 학습 데이터 구축 결과물은 원천 데이터, 라벨 파일, 메타데이터, 기준서, 품질검수 리포트, 납품 포맷 설명서로 구성되는 것이 일반적입니다. 프로젝트 목적에 따라 JSON, CSV, COCO, YOLO, XML, JSONL 등 다양한 형태로 납품될 수 있습니다.
AI 데이터 수집에서 파일명·폴더 구조는 데이터 추적성과 납품 품질을 좌우합니다. 파일 구조가 정리되어 있지 않으면 라벨 파일 매칭, 검수, 재학습, 오류 수정 과정에서 혼선이 발생합니다.
OCR 라벨링에서 문서 구조 정보가 중요한 이유는 AI가 글자만 읽는 것이 아니라 제목, 표, 항목, 값, 각주 같은 정보의 관계를 이해해야 하기 때문입니다. 구조 정보가 없으면 추출된 텍스트를 업무 데이터로 활용하기 어렵습니다.
문서 라벨링에서 표와 항목 구조를 분리해야 하는 이유는 AI가 문서 안의 글자뿐 아니라 정보의 위치와 관계를 이해해야 하기 때문입니다. 필드명과 값, 표의 행과 열, 제목과 본문 관계가 분리되어야 검색과 자동화에 활용할 수 있습니다.
라벨링 납품 포맷을 프로젝트 초기에 정해야 하는 이유는 작업 기준, 파일 구조, 라벨 속성, 검수 방식이 포맷에 따라 달라지기 때문입니다. 후반부에 포맷을 바꾸면 변환 오류와 재검수가 발생할 수 있습니다.
데이터 전처리에서 해상도와 포맷을 통일해야 하는 이유는 모델 학습 파이프라인이 일정한 입력 구조를 필요로 하기 때문입니다. 입력 크기와 파일 형식이 제각각이면 학습 오류, 처리 지연, 성능 편차가 발생할 수 있습니다.
AI 데이터 가공 결과를 학습 파이프라인에 맞추려면 파일 구조, 라벨 포맷, 클래스명, 메타데이터, 데이터 분할 기준, 버전 정보가 모델 개발 환경과 일치해야 합니다. 단순히 파일을 정리하는 것만으로는 충분하지 않습니다.
파일명 규칙은 AI 데이터 품질에 직접 영향을 줍니다. 파일명이 불규칙하면 원천 데이터와 라벨 파일의 매칭, 검수, 오류 수정, 버전 관리, 학습 파이프라인 연결이 어려워집니다.
JSON, CSV, COCO, YOLO 포맷은 데이터 유형과 고객사의 모델 학습 환경에 따라 선택합니다. 객체 탐지, 분류, 문서 구조화, NLP, RAG 등 작업 목적마다 적합한 납품 포맷이 다릅니다.
납품 전 최종 검수 체크리스트에는 수량, 파일 구조, 라벨 포맷, 클래스 매핑, 메타데이터, 품질 리포트, 개인정보, 샘플 열람 결과, 사이트 또는 시스템 적용 가능 여부가 포함되어야 합니다.
끼임·협착 위험 데이터에는 사람, 설비, 움직이는 부품, 위험구역, 접근 거리, 손·팔·몸의 위치, 위험상태 라벨이 필요합니다. 단순히 사람과 기계를 감지하는 것만으로는 협착 위험을 충분히 판단하기 어렵습니다.
중대재해 예방 AI용 데이터셋은 원천 데이터, 합성 이미지·영상, 라벨 파일, 메타데이터, 시나리오 기준서, 품질검수 리포트, 납품 포맷 설명서 형태로 정리해 납품하는 것이 좋습니다. 산출물이 체계적이어야 모델 학습과 재검수가 가능합니다.
공공 행정 문서 데이터는 제목, 조항, 본문, 표, 첨부, 날짜, 기관명, 민원 유형 같은 구조 정보를 분리해 AI 학습용으로 정리해야 합니다. 단순 OCR 텍스트가 아니라 검색과 요약에 활용 가능한 구조화 데이터로 만드는 것이 중요합니다.
데이터 납품 후 검수 기간은 고객이 산출물 수량, 포맷, 라벨 품질, 메타데이터, 샘플 실행, 개인정보 비식별화 여부를 확인할 수 있도록 일정에 포함해야 합니다. 검수 기간은 단순 확인이 아니라 최종 승인 절차입니다.
AI 데이터 구축 결과물의 소유권과 활용 범위는 계약서나 과업지시서에서 원천 데이터, 가공 데이터, 라벨 파일, 메타데이터, 기준서, 리포트를 구분해 정해야 합니다. 어떤 결과물을 누가 어디까지 사용할 수 있는지 명확해야 합니다.
정부지원사업용 AI 데이터 구축 산출물은 계약·과업지시서 기준에 맞춰 데이터셋, 라벨 파일, 품질검수 리포트, 구축 기준서, 작업 결과 요약, 납품 확인 자료를 정리해야 합니다. 지원사업은 수행 증빙과 결과물 설명이 중요합니다.
다른 분야 지식도 확인해보세요
OTHER KNOWLEDGE AREAS
AI 학습 데이터 기본 개념
학습 데이터의 기준과 기본 개념 보기 →
AI 데이터 수집
수집 조건과 원천 데이터 구축 기준 보기 →
AI 데이터 라벨링
라벨링 기준과 품질관리 방법 보기 →
AI 데이터 가공·품질관리
정제, 전처리, 품질검수 기준 보기 →
합성데이터·산업재해 데이터
희귀 상황과 산업안전 데이터 구축 보기 →
산업별 AI 데이터 활용
제조, 의료, 공공 등 산업별 활용 기준 보기 →
데이터 바우처·프로젝트 진행
데이터 바우처와 프로젝트 절차 보기 →
지식검색센터 전체 보기
전체 FAQ와 검색 기능으로 돌아가기 →
AI 학습 데이터 구축, 처음 설계가 중요합니다.
필요한 데이터의 종류, 수량, 라벨 기준, 납품 포맷이 아직 명확하지 않아도 괜찮습니다. 프롬데이터가 프로젝트 목적에 맞는 AI 학습 데이터 구축 범위부터 함께 정리해드립니다.
