Date: 2026-08-27 Topic: 피지컬 AI·로보틱스 Primary source: TechCrunch
로봇 개발 업계가 더 크고 정교한 하드웨어보다 데이터를 모으고 실패를 학습하는 과정에 주목하고 있다. TechCrunch는 8월 26일(현지시간) 샌프란시스코에서 열린 로봇 개발자 행사 ‘Actuate 26’의 논의를 전하며, 피지컬 AI가 아직 언어 모델의 초기 단계에 비견될 만큼 훈련 데이터와 시뮬레이션, 현장 검증 도구가 부족하다고 보도했다.
행사에서는 범용 휴머노이드가 곧 일상에 들어올 것이라는 기대와 달리, 실제 작업에서 반복 가능한 성능을 내는 일이 여전히 어렵다는 진단이 이어졌다. 자율주행차처럼 많은 운행 데이터를 축적한 분야가 상대적으로 앞서 있으며, 로봇 기업들은 좁은 작업부터 상용화할지 범용 지능을 먼저 키울지를 놓고 서로 다른 전략을 택하고 있다.
이번 논의가 중요한 이유는 로봇 경쟁의 중심이 모터와 관절 같은 하드웨어 사양에서 데이터 수집·검색·재현·평가를 잇는 개발 체계로 옮겨가고 있기 때문이다. 이는 로봇 제조사뿐 아니라 AI 모델, GPU, 시뮬레이션과 개발 도구를 공급하는 기업에도 직접 영향을 미친다.
What Happened
Actuate 26은 로봇 데이터 플랫폼 기업 Foxglove가 8월 18~19일 개최한 개발자 행사다. 사전 안내에서는 1,000명 이상의 개발자가 모일 것으로 예상됐고, Foxglove는 행사 후 TechCrunch에 참석자가 약 1,500명이라고 밝혔다. 발표 주제도 자율주행과 휴머노이드, 강화학습, 시뮬레이션, 현장 데이터 관리처럼 ‘로봇을 실제로 작동시키는 방법’에 집중됐다.
보도에서 시뮬레이션 스타트업 Antioch의 공동창업자 해리 멜솝은 현재 피지컬 AI를 언어 모델의 ‘GPT-2 시기’에 빗댔다. 이는 업계 전체가 합의한 기술 단계나 공식 성능 지표가 아니라, 데이터와 연산 자원이 더 쌓여야 상용 제품의 도약이 가능하다는 설명을 위한 비유다.
Key Details
- 데이터 부족: 로봇은 카메라 영상뿐 아니라 라이다, 관절 위치, 힘과 토크, 제어 명령을 동시에 기록한다. 드물게 발생하는 실패 장면을 찾아 다시 학습에 쓰는 작업도 쉽지 않다.
- 시뮬레이션과 현실의 차이: Foxglove는 자사 제품 설명에서 실험실 성공률이 95%인 로봇도 현장에서는 60%를 넘기기 어렵다는 사례를 들었다. 이는 피지컬 AI 전체를 대표하는 통계가 아니라 회사가 설명한 전형적 문제 사례다.
- 분야별 데이터 격차: 자율주행은 사람이 운전한 차량과 대규모 운행에서 데이터를 계속 수집할 수 있어 비교적 앞서 있다. 반면 물체를 잡고 밀고 정리하는 조작 작업은 접촉 결과가 복잡하고, 실패가 기기나 주변 환경의 손상으로 이어질 수 있다.
- 상용화 전략의 갈림길: 건설·물류·태양광 설비처럼 제한된 작업에 먼저 투입하면 매출과 현장 데이터를 얻기 쉽다. 하지만 특정 작업에 지나치게 맞춘 시스템은 더 범용적인 모델이 등장했을 때 경쟁력을 잃을 수 있다.
Foxglove는 이런 병목을 줄이기 위해 행사 기간에 피지컬 AI용 데이터 플랫폼 기능을 공개했다. 새 시맨틱 검색은 엔비디아의 Cosmos 계열 영상·텍스트 모델을 활용해 개발자가 “야간에 차선을 잘못 인식한 합류 장면”처럼 자연어로 로봇 기록을 찾도록 돕는다. 여러 실행 기록을 비교하고 원격 로봇을 점검하며, 실제 데이터를 다시 평가와 시뮬레이션에 넣는 시간도 줄이겠다는 구상이다.
Background
피지컬 AI는 디지털 화면 안에서 답을 생성하는 데 그치지 않고, 카메라와 센서로 주변을 이해한 뒤 차량이나 로봇의 움직임으로 결과를 내는 AI를 뜻한다. 언어 모델은 같은 문장을 대량으로 복제해 훈련하거나 정답을 자동 채점하기가 비교적 쉽지만, 로봇은 무게와 마찰, 조명, 센서 오차처럼 현실의 변수를 함께 다뤄야 한다.
따라서 로봇의 발전 속도는 모델 크기만으로 결정되지 않는다. 어떤 실패를 기록할지, 필요한 장면을 데이터 더미에서 얼마나 빨리 찾을지, 시뮬레이션에서 얻은 행동이 현실에서도 안전하게 작동하는지 검증하는 과정이 모두 필요하다. 엔비디아 Cosmos 같은 월드 모델도 현실을 대신하는 완성품이라기보다, 다양한 상황을 생성하고 검색해 이 학습 과정을 보조하는 도구에 가깝다.
Core Lens
피지컬 AI의 다음 도약은 더 화려한 로봇 시연보다, 실패를 빠르게 찾아 재현하고 개선하는 학습 순환을 얼마나 짧게 만드느냐에 달려 있다.
What It Means
소프트웨어 서비스는 업데이트 한 번으로 수많은 사용자에게 새 기능을 배포할 수 있다. 로봇은 하드웨어 생산과 설치, 안전 점검이 필요해 같은 속도로 확산되기 어렵다. 그래서 업계 관계자들이 말하는 ‘로봇의 챗GPT 순간’도 하나의 모델 공개일보다, 특정 가격대의 기기가 여러 환경에서 쓸 만한 성공률을 꾸준히 내는 시점에 가까울 가능성이 크다.
개발 도구 시장도 함께 커질 수 있다. 실제 경쟁력은 센서 데이터를 한곳에 모으는 것에서 끝나지 않고, 실패 장면을 검색해 학습 데이터로 바꾸고 수정 전후의 결과를 같은 기준으로 비교하는 능력에서 생긴다. 다만 플랫폼 기업이 제시하는 실험실·현장 성능 수치는 독립 평가가 아니므로, 실제 고객 환경에서 같은 개선이 재현되는지 따로 확인해야 한다.
What To Watch
- 9월 2일 예정된 Foxglove 제품 시연에서 자연어 검색과 에이전트 기능이 대규모 로봇 기록에서도 정확히 작동하는지
- 범용 휴머노이드보다 물류·건설·제조처럼 범위가 좁은 로봇이 먼저 안정적인 매출과 현장 데이터를 확보하는지
- 기업들이 조작 성공률과 안전 개입 횟수, 시뮬레이션 대비 현장 성능처럼 비교 가능한 지표를 공개하는지
- 현장 영상과 작업자 모습이 포함된 로봇 데이터의 소유권·보안·개인정보 문제를 어떻게 해결하는지