문서·OCR 데이터
문서·OCR 데이터는 PDF, 스캔 문서, 표, 송장, 번호판, 행정 문서 등 비정형 문서를 AI가 읽을 수 있게 구조화하는 데이터입니다.
AI 데이터 수집 결과를 고객이 검수할 때는 수량뿐 아니라 클래스 분포, 조건 다양성, 파일 품질, 누락 여부, 개인정보, 납품 포맷, 샘플 라벨 가능성을 함께 확인해야 합니다.
OCR 라벨링에서 문서 구조 정보가 중요한 이유는 AI가 글자만 읽는 것이 아니라 제목, 표, 항목, 값, 각주 같은 정보의 관계를 이해해야 하기 때문입니다. 구조 정보가 없으면 추출된 텍스트를 업무 데이터로 활용하기 어렵습니다.
라벨링 품질 리포트에는 작업 범위, 검수 기준, 오류 유형, 오류율, 수정 내역, 샘플 이미지, 최종 납품 포맷, 잔여 이슈가 들어가야 합니다. 리포트는 데이터 신뢰도를 설명하는 근거 자료입니다.
데이터 라벨링에서 예외 케이스 기준을 문서화해야 하는 이유는 실제 데이터에는 기준서의 기본 규칙만으로 판단하기 어려운 상황이 반복해서 나오기 때문입니다. 예외 기준이 없으면 작업자마다 다른 결정을 하게 됩니다.
문서 라벨링에서 표와 항목 구조를 분리해야 하는 이유는 AI가 문서 안의 글자뿐 아니라 정보의 위치와 관계를 이해해야 하기 때문입니다. 필드명과 값, 표의 행과 열, 제목과 본문 관계가 분리되어야 검색과 자동화에 활용할 수 있습니다.
공공 행정 문서 데이터는 제목, 조항, 본문, 표, 첨부, 날짜, 기관명, 민원 유형 같은 구조 정보를 분리해 AI 학습용으로 정리해야 합니다. 단순 OCR 텍스트가 아니라 검색과 요약에 활용 가능한 구조화 데이터로 만드는 것이 중요합니다.
행정 문서 아카이빙 데이터와 RAG 데이터는 문서 내용을 의미 단위로 구조화하고, 검색 가능한 청크와 메타데이터로 변환하는 과정에서 연결됩니다. 아카이빙이 보존 중심이라면 RAG는 AI가 근거를 찾아 답변하도록 만드는 활용 중심 구조입니다.
물류 OCR 데이터는 일반 OCR보다 이동, 오염, 훼손, 각도 왜곡, 바코드·송장·컨테이너 번호 같은 현장 변수가 많습니다. 따라서 글자 인식뿐 아니라 물류 필드 구조와 운영 시스템에 맞는 데이터 정리가 필요합니다.
모빌리티 OCR에서 번호판·송장 데이터 품질은 문자 인식 정확도뿐 아니라 촬영 조건, 객체 위치, 필드 구조, 판독 불가 처리 기준, 검수 이력으로 관리해야 합니다. 이동체와 물류 현장 데이터는 오류 유형이 다양해 품질 기준이 필요합니다.
공공기관 AI 데이터 구축에서는 보안과 표준을 함께 봐야 합니다. 개인정보와 행정 자료를 안전하게 관리하면서도, 기관 시스템과 호환되는 데이터 포맷·메타데이터·품질 기준을 맞춰야 실제 활용이 가능합니다.
보험·금융 문서 AI에는 계약서, 약관, 청구서, 상담 로그, 심사 문서 같은 비정형 데이터를 텍스트 추출, 필드 구조화, 개체명 인식, 요약, RAG용 청킹 형태로 가공하는 작업이 필요합니다. 문서의 의미와 구조를 함께 보존해야 합니다.
공공 민원 챗봇용 데이터는 민원 유형, 질문 의도, 관련 법령·절차, 답변 근거, 예외 상황, 후속 안내를 구조화해 구축합니다. 단순 상담 문장 모음이 아니라 근거 기반 답변이 가능한 지식 베이스와 대화 시나리오가 필요합니다.
다른 분야 지식도 확인해보세요
OTHER KNOWLEDGE AREAS
AI 학습 데이터 기본 개념
학습 데이터의 기준과 기본 개념 보기 →
AI 데이터 수집
수집 조건과 원천 데이터 구축 기준 보기 →
AI 데이터 라벨링
라벨링 기준과 품질관리 방법 보기 →
AI 데이터 가공·품질관리
정제, 전처리, 품질검수 기준 보기 →
합성데이터·산업재해 데이터
희귀 상황과 산업안전 데이터 구축 보기 →
산업별 AI 데이터 활용
제조, 의료, 공공 등 산업별 활용 기준 보기 →
데이터 바우처·프로젝트 진행
데이터 바우처와 프로젝트 절차 보기 →
지식검색센터 전체 보기
전체 FAQ와 검색 기능으로 돌아가기 →
AI 학습 데이터 구축, 처음 설계가 중요합니다.
필요한 데이터의 종류, 수량, 라벨 기준, 납품 포맷이 아직 명확하지 않아도 괜찮습니다. 프롬데이터가 프로젝트 목적에 맞는 AI 학습 데이터 구축 범위부터 함께 정리해드립니다.
