M

㈜프롬데이터
고품질 AI학습 데이터 수집 및 가공 전문 기업

© 2025 fromdata
sales@thefromdata.com
Privacy Policy

정부는 왜 피지컬 AI 데이터에 1조를 넘게 쓰는가

08.24.2026

로봇 팔은 이미 충분히 좋습니다. 액추에이터도, 센서도, 모터 제어도 10년 전과 비교가 안 됩니다. 그런데 왜 공장에서 사람처럼 일하는 로봇을 아직 못 보고 계실까요. 답은 하드웨어가 아니라 피지컬 AI 데이터에 있습니다. 로봇에게 “이 부품을 저기 끼워라”를 가르칠 데이터가, 세상에 거의 없기 때문입니다.

정부도 같은 진단을 내렸습니다. 2026년 6월 29일 청와대에서 열린 국민보고회에서 산업통상부는 2030년까지 피지컬 AI 세계 1위를 선언했고, 그 실행 수단의 상당 부분이 데이터에 집중돼 있습니다. 이 글은 왜 지금 로봇 행동데이터가 국가 어젠다가 됐는지, 그리고 데이터를 만들고 다루는 기업 입장에서 무엇이 달라지는지를 정리한 것입니다.

정부가 피지컬 AI 데이터에 1조를 넘게 쓰는 이유

먼저 규모부터 보겠습니다. 정부는 2026년부터 2030년까지 경남·전북을 중심으로 한 피지컬 AI 기반 산업 AI 전환 연구개발에 1조 4,131억원을 투입하는 계획을 세웠습니다. 여기에 더해 국민보고회에서는 휴머노이드 로봇의 글로벌 점유율을 현재 약 1%에서 2030년 20%까지 끌어올리겠다는 목표가 제시됐습니다.

정부 피지컬 AI 데이터 정책 핵심 지표 카드

2026년 6월 국민보고회에서 제시된 피지컬 AI 데이터 관련 정책 지표.

보고회가 지목한 최대 난관은 결국 피지컬 AI 데이터였다

흥미로운 건 이 자리에서 나온 전문가 코멘트입니다. 최준원 서울대 전기정보공학부 교수는 로봇이 “데이터 학습 → 실행 → 부족한 점을 보완할 데이터 수집 → 재학습”의 순환을 돌아야 하는데 학습할 데이터가 충분하지 않다며, 이 플랫폼을 미국 엔비디아도 중국도 아직 완성하지 못했다고 지적했습니다. 그리고 “로봇 학습 데이터 확보가 최대 난관”이라고 못 박았습니다.

이 발언이 중요한 이유는, 국가 전략 발표 자리에서 병목이 하드웨어가 아니라 데이터로 공식 확인됐다는 점입니다. 실제로 정부 계획에는 자동차·조선 등 10대 업종별로 AI 로봇 학습에 필요한 데이터를 모으는 ‘데이터팩토리’ 구축이 포함돼 있고, 그 목적은 로봇 파운데이션 모델의 해외 의존도를 낮추는 것입니다. 모델을 만들려면 데이터가 있어야 하고, 데이터가 없으면 남의 모델을 빌려 쓸 수밖에 없다는 논리입니다.

‘데이터 수매제’라는 발상이 나온 배경

같은 보고회에서 엄윤설 에이로봇 대표는 제조 노동자가 가슴에 바디캠을 달아 작업 동작을 기록하면 정부가 이를 쌀 수매하듯 사들여 데이터센터에 모으고, 기업·대학·연구기관이 자유롭게 쓰도록 하자는 ‘데이터 수매제’를 제안했습니다. 아직 제안 단계이지 확정된 제도는 아닙니다. 다만 이 아이디어가 나온 맥락은 짚어둘 필요가 있습니다.

엄 대표가 든 이유는 표준의 부재였습니다. “표준이 없어 로봇 기업마다 데이터 취득 프로토콜이 다 다른 상황”이라는 것이죠. 이건 데이터 업계 입장에서 대단히 익숙한 문제입니다. 클래스 정의가 회사마다 다르고, 파일 포맷이 다르고, 품질 기준이 다르면 아무리 많이 모아도 합쳐서 쓸 수가 없습니다. 피지컬 AI 데이터는 지금 딱 그 단계에 있습니다.

피지컬 AI 데이터는 기존 학습 데이터와 무엇이 다른가

인터넷에서 긁어올 수 없는 데이터

언어 모델은 웹 텍스트로 학습했고, 이미지 모델은 웹 이미지로 학습했습니다. 크롤링이라는 저렴한 수집 경로가 있었다는 뜻입니다. 로봇은 그게 안 됩니다. 로봇이 물건을 잡을 때 손끝에 걸리는 힘, 미끄러졌을 때의 보정 동작, 각도가 안 맞아 다시 시도하는 과정. 이런 건 실제로 누군가 그 동작을 수행하고 기록해야만 생깁니다.

그래서 피지컬 AI 데이터는 태생적으로 “수집이 곧 원가”인 데이터입니다. 이미지 라벨링은 이미 존재하는 이미지에 라벨을 붙이는 작업이지만, 로봇 행동데이터는 데이터 자체를 처음부터 만들어내야 합니다. 이 차이가 뒤에서 볼 단가 구조를 전부 결정합니다.

실패가 자산이 되는 유일한 데이터

또 하나 다른 점은 실패 데이터의 가치입니다. 이미지 분류에서 잘못된 라벨은 그냥 오류지만, 로봇 학습에서 “잡으려다 놓친 기록”은 지워야 할 오류가 아니라 반드시 있어야 할 학습 신호입니다. 실패와 재시도가 없는 데이터셋으로 학습한 로봇은 현장에서 한 번 어긋나면 복구하지 못합니다.

이 점은 데이터 구축 실무에 그대로 영향을 줍니다. 기존 라벨링 프로젝트에서는 애매한 샘플을 걸러내는 게 품질 관리였는데, 로봇 데이터에서는 그 애매한 구간이 오히려 핵심입니다. 검수 기준서를 짜는 방식 자체가 달라져야 한다는 뜻입니다.

1인칭과 3인칭, 피지컬 AI 데이터의 두 축

그렇다면 그 비싼 데이터를 어떻게 모을까요. 최근 흐름은 로봇을 직접 움직이는 대신 사람의 작업 영상을 쓰는 쪽으로 기울고 있습니다. 그리고 그 영상은 시점에 따라 담기는 정보가 완전히 다릅니다.

피지컬 AI 데이터 1인칭 3인칭 시점 비교

피지컬 AI 데이터는 1인칭과 3인칭이 서로 다른 정보를 담기 때문에 조합 설계가 필요하다.

에고센트릭(1인칭)이 담는 것

작업자가 카메라를 착용하고 찍은 1인칭 영상은 손과 물체가 어떻게 접촉하는지, 어떤 순서로 작업이 진행되는지를 세밀하게 보여줍니다. 로봇의 헤드 카메라가 실제로 보게 될 화면과 구도가 같다는 것도 큰 장점입니다. 손이 아래에서 화면으로 들어오고, 대상물이 작업대 높이에 있고, 조작하는 손 자체가 시야를 가리는 상황. 이런 조건이 학습 데이터에 그대로 담깁니다.

3인칭 영상이 담는 것

반대로 CCTV처럼 외부에서 찍은 3인칭 영상은 전신 움직임과 자세, 주변 사람·사물과의 관계, 공간적 맥락을 보여줍니다. 여기서 추출한 3D 포즈는 휴머노이드의 제어 신호로 변환하기 좋습니다. 1인칭 영상만으로는 작업자가 지금 어떤 자세로 서 있는지 알 수 없다는 걸 생각하면 왜 둘 다 필요한지 자연스럽게 이해됩니다.

1,000시간과 100시간의 차이

두 시점을 결합한 실험 결과가 최근 나왔습니다. 중국 베이징대 저우다취안 교수 연구팀은 1인칭과 3인칭을 통합한 100만 시간 규모의 영상 데이터셋 ‘휴먼넷’을 구축했는데, 이 영상 1,000시간으로 사전학습한 모델이 실제 로봇 데이터 100시간으로 학습한 모델보다 우수한 성능을 보였다고 보고됐습니다.

숫자만 보면 영상 쪽이 10배 더 많은 시간을 쓴 것이니 당연해 보일 수 있습니다. 하지만 단가를 얹어 보면 이야기가 완전히 달라집니다. 뒤에서 보겠지만 로봇을 직접 원격 조작해 데이터를 만드는 비용은 영상 수집의 몇 배입니다. 즉 “같은 예산으로 훨씬 좋은 모델을 만들 수 있다”는 결론이 됩니다. 국내에서도 KAIST 주재걸 교수 연구팀이 3인칭 영상만으로 1인칭 시야를 생성하는 모델 ‘에고엑스(EgoX)’를 내놓는 등, 영상을 로봇 학습 자원으로 전환하는 연구가 활발합니다.

피지컬 AI 데이터 수집 비용은 어떻게 매겨지는가

여기서부터가 실무입니다. 기존 이미지 라벨링에 익숙하신 분들은 단가표를 처음 보면 당황하실 겁니다. 단위 자체가 다릅니다.

피지컬 AI 데이터 수집 방식별 시간당 단가 비교

피지컬 AI 데이터는 장당이 아니라 시간당으로 값이 매겨진다.

2026년 벤치마크 기준으로 에고센트릭 원본 수집은 시간당 15~22달러 수준이고, 손 포즈와 객체 추적, 작업 구간 분할까지 붙인 완전 어노테이션은 시간당 30~40달러로 올라갑니다. 로봇을 직접 원격 조작하는 텔레오퍼레이션은 시간당 28~60달러, 특정 로봇 전용 리그와 숙련 조작자가 필요한 경우 50~200달러까지 벌어집니다. 500회 이상의 시연으로 구성된 프로덕션급 데이터셋 하나를 장비·인건비·후처리까지 포함해 산정하면 5만~20만 달러 규모라는 추정도 나와 있습니다.

왜 장당이 아니라 시간당인가

이미지 라벨링은 “이미지 1장”이라는 명확한 단위가 있습니다. 행동 데이터에는 그게 없습니다. 부품 하나를 조립하는 데 12초가 걸릴 수도 있고 4분이 걸릴 수도 있으며, 그 안에서 유효한 학습 신호가 몇 개 나오는지는 작업 성격에 따라 다릅니다. 그래서 결국 시간으로 계약하게 됩니다.

발주하는 입장에서는 이 구조가 위험합니다. 시간당 계약은 “느리게 일할수록 돈을 더 받는” 구조이기 때문입니다. 그래서 시간 단가와 함께 시간당 유효 시연 수를 반드시 함께 정의해야 합니다. 예를 들어 “1시간당 성공 시연 40회 이상, 실패·재시도 시퀀스 10회 이상 포함”처럼 산출물 기준을 걸어두는 방식입니다.

총원가를 구성하는 항목들

  • 수집 장비: 카메라 리그, 착용 마운트, IMU, 필요 시 시선 추적 모듈. 텔레오퍼레이션이면 조작 장비까지.
  • 수집 인력: 해당 작업을 실제로 할 줄 아는 사람이어야 합니다. 숙련 작업자의 시간은 라벨링 작업자의 시간보다 비쌉니다.
  • 현장 확보: 실제 공장·창고에서 찍어야 하므로 라인 협조와 안전 관리 비용이 붙습니다.
  • 동기화·후처리: 여러 센서의 타임스탬프 정렬, 캘리브레이션, 손상 구간 제거.
  • 어노테이션: 손-객체 접촉 구간, 작업 단계 분할, 객체 추적. 여기가 기존 라벨링 역량이 그대로 쓰이는 구간입니다.
  • 개인정보 처리: 영상에 잡히는 얼굴과 신원 정보의 비식별 처리.

시뮬레이션과 합성 데이터는 피지컬 AI 데이터를 대체할 수 있는가

“가상 환경에서 로봇을 수만 번 돌리면 되지 않나요?” 자주 나오는 질문이고, 절반은 맞습니다.

시뮬레이션이 잘 통하는 구간

물리 엔진이 정확하게 계산할 수 있는 영역, 즉 강체의 이동과 충돌, 경로 계획, 조명 변화 같은 것은 시뮬레이션이 압도적으로 저렴합니다. 실패해도 부품이 깨지지 않고, 밤새 돌려도 인건비가 들지 않습니다. 희소한 상황을 인위적으로 많이 만들 수 있다는 것도 큰 장점입니다. 현장에서 1년에 두세 번 나오는 이상 상황을 시뮬레이터에서는 하루에 수천 번 생성할 수 있습니다.

시뮬레이션이 무너지는 구간

문제는 접촉입니다. 부드러운 재질이 눌리는 정도, 표면 마찰, 케이블이 늘어지는 형태, 젖은 부품이 미끄러지는 순간. 이런 것은 현재 물리 엔진이 충분히 정확하게 재현하지 못합니다. 시뮬레이션에서 완벽했던 로봇이 실제 라인에서 첫날 실패하는 이유가 대부분 여기 있습니다. 업계에서 현실 격차(sim-to-real gap)라고 부르는 문제입니다.

그래서 현실적인 답은 역할 분담입니다. 시뮬레이션과 합성 데이터로 양을 채우고, 실제 피지컬 AI 데이터로 접촉 구간과 실패 패턴을 보정하는 구조입니다. 중요한 건 실데이터가 적어도 되는 게 아니라, 실데이터를 어디에 쓸지가 달라진다는 점입니다. 시뮬레이션을 도입한다고 실데이터 수집 예산을 없애면 결국 현장에서 되돌아옵니다.

국내 기업이 지금 확인해야 할 것들

정책은 나왔고 예산도 편성됐습니다. 하지만 앞서 지적된 대로 표준은 아직 없습니다. 지금 데이터를 모으기 시작하는 기업이라면 나중에 국가 데이터팩토리나 산업 표준이 정리됐을 때 그 데이터를 버리지 않으려면 최소한 아래는 챙겨두셔야 합니다.

  • 영상의 해상도·프레임레이트·시야각을 프로젝트 전체에서 고정했는가. 중간에 장비를 바꾸면 그 앞뒤가 다른 데이터가 됩니다.
  • 여러 센서의 타임스탬프 동기화 오차를 측정하고 기록했는가. 밀리초 단위 어긋남이 나중에 치명적입니다.
  • 카메라 캘리브레이션 파라미터를 데이터와 함께 보관하고 있는가.
  • 작업 단계 정의(taxonomy)를 문서화했는가. “집기·이동·정렬·삽입·확인”처럼 단계가 명확해야 재사용됩니다.
  • 실패·재시도 구간을 삭제하지 않고 태깅해서 보존하고 있는가.
  • 촬영 대상 작업자의 영상 활용 동의와 개인정보 비식별 절차를 갖췄는가.
  • 공장 내부가 찍힌 영상의 보안 등급과 반출 범위를 사전에 합의했는가.
  • 메타데이터에 작업자 숙련도, 작업 환경, 조명 조건을 남기고 있는가. 나중에 데이터 편향을 진단할 유일한 근거입니다.

여덟 개 중 다섯 개 이상 바로 답할 수 없다면, 지금 모으고 계신 영상은 몇 달 뒤 다시 찍어야 할 가능성이 높습니다. 수집은 되돌릴 수 없는 작업이라 더 그렇습니다.

피지컬 AI 데이터 수집, 어디서부터 시작할 것인가

전사 차원의 대규모 프로젝트로 접근하면 대체로 시작조차 못 합니다. 현실적인 순서는 이렇습니다.

첫째, 작업 하나를 고릅니다. 반복 빈도가 높고, 실패가 실제로 발생하며, 자동화됐을 때 효과가 명확한 작업이어야 합니다. 여러 작업을 동시에 담으려는 시도가 초기 프로젝트를 가장 많이 망칩니다.

둘째, 10시간 분량으로 파일럿을 돌립니다. 목적은 데이터를 모으는 게 아니라 촬영 스펙과 정의서를 검증하는 것입니다. 이 단계에서 대체로 카메라 위치, 시야각, 작업 단계 구분이 전부 한 번씩 바뀝니다. 10시간을 버릴 각오로 찍어야 나머지 수백 시간을 살립니다.

셋째, 스펙을 고정하고 확장합니다. 파일럿에서 나온 촬영 스펙, 작업 단계 정의, 메타데이터 항목을 문서로 확정한 뒤 규모를 늘립니다. 이 문서가 없으면 확장한 만큼 정확히 재작업이 늘어납니다.

기존 데이터 구축 경험은 피지컬 AI 데이터에서 어디까지 통하는가

솔직하게 정리하면 이렇습니다. 새로 배워야 하는 영역과 그대로 쓰이는 영역이 나뉩니다.

새로 배워야 하는 쪽은 수집 파트입니다. 카메라 리그 설계, 다중 센서 동기화, 현장 촬영 운영은 이미지 라벨링과 접점이 거의 없는 별개의 일입니다. 여기서 “우리도 예전부터 해왔다”고 말하는 업체가 있다면 장비 구성과 동기화 오차 수치를 물어보시면 됩니다.

반면 수집 이후 구간은 기존 역량이 거의 그대로 이어집니다. 손과 객체의 접촉 구간을 프레임 단위로 표시하는 일, 작업 단계를 시간축으로 분할하는 일, 객체를 추적하며 마스크를 유지하는 일. 전부 AI 데이터 라벨링의 연장선입니다. 클래스 정의서를 쓰고, 골든셋으로 검수하고, 작업자 간 일치도를 측정하는 AI 데이터 가공 방법론도 그대로 적용됩니다. 오히려 표준이 없는 지금 상황에서는 이 방법론을 갖춘 쪽이 유리합니다.

김동환 프롬데이터 대표는 “피지컬 AI 데이터라고 하면 다들 로봇과 장비 이야기부터 하지만, 결국 쓸 수 있는 데이터냐를 가르는 건 정의서와 검수 체계”라며 “업계 표준이 아직 정리되지 않은 지금은 각자의 기준을 문서로 남겨두는 기업만이 나중에 데이터를 재사용할 수 있을 것”이라고 말했습니다.

피지컬 AI 데이터에 대해 자주 묻는 질문

우리 공장 CCTV 영상도 피지컬 AI 데이터로 쓸 수 있나요

조건부로 가능합니다. 실제로 외부 관찰 시점 영상이 로봇 학습 자원으로 주목받는 흐름이 있고, 그 관점에서 CCTV는 이미 쌓여 있다는 큰 장점이 있습니다. 다만 그대로 쓰이지는 않습니다. 대부분의 CCTV는 프레임레이트가 낮고, 각도가 작업이 아니라 감시에 맞춰져 있으며, 손 움직임을 볼 만한 해상도가 나오지 않습니다. 보관 기간이 짧아 이미 삭제된 경우도 많습니다. 현실적인 접근은 기존 영상을 후보 자산으로 검토하되, 학습용으로는 작업 구간에 카메라를 추가 배치하는 쪽입니다.

몇 시간 분량을 모아야 의미가 있나요

작업의 다양성에 달려 있어 일률적인 답은 없습니다. 다만 구조적으로 보면, 한 가지 단순 작업을 여러 조건에서 안정적으로 수행시키는 수준이라면 수십 시간 규모부터 의미 있는 실험이 가능하고, 범용성을 노린다면 자릿수가 달라집니다. 그래서 처음부터 대규모로 가기보다 하나의 작업을 정해 파일럿을 돌리고, 시간당 유효 시연 수와 모델 성능 개선폭을 실측한 뒤 확장 규모를 정하시는 편이 안전합니다.

기존 라벨링 업체에 맡겨도 되나요

수집과 가공을 나눠서 보셔야 합니다. 어노테이션과 검수는 기존 라벨링 역량이 그대로 통하지만, 촬영 리그 구성과 다중 센서 동기화는 별개의 역량입니다. 한 업체가 전부 한다고 하면 각 구간을 실제로 어떻게 수행하는지, 특히 동기화 오차를 어떻게 측정하고 관리하는지 구체적으로 확인해보시기 바랍니다.

정리하며

지금 벌어지고 있는 일을 한 문장으로 요약하면 이렇습니다. 데이터 산업의 무게중심이 웹에서 긁어오는 데이터에서 현장에서 만들어내는 데이터로 옮겨가고 있습니다. 정부가 1조 원대 예산과 데이터팩토리 구상을 내놓은 것도, 전문가들이 하드웨어가 아니라 데이터를 병목으로 지목한 것도 같은 흐름입니다.

당장 로봇 사업을 하실 게 아니더라도, 제조·물류·건설 현장을 가지고 계신 기업이라면 지금 그 현장에서 흘려보내고 있는 영상이 몇 년 뒤 자산이 될 수 있습니다. 문제는 아무렇게나 찍은 영상은 자산이 되지 않는다는 것이고, 그 차이를 만드는 게 수집 설계와 품질 기준입니다. 좋은 AI 학습 데이터의 조건은 도메인이 바뀌어도 달라지지 않습니다. 현재 운영 중인 AI 데이터 서비스 구성도 이 관점에서 확장해가고 있습니다.

다음 편에서는 한 단계 더 들어가, 에고센트릭 데이터를 실제로 수집할 때 정해야 하는 촬영 스펙과 손-객체 접촉 라벨링 기준을 실무 수준으로 다루겠습니다.

필요한 데이터를 가장 정확하게 준비하는 방법

가장 효율적인 데이터 구축 방법을 함께 찾겠습니다.

X