
인공지능(AI)의 ‘화면 밖 진출’이 본격화되고 있다. 사람의 질문에 답하고 문서를 만드는 생성형 AI를 넘어, 주변 환경을 이해하고 직접 이동하며 물체를 다루는 ‘피지컬 AI(Physical AI)’를 두고 미국과 중국의 경쟁 구도가 격화되는 모양새다. 흥미로운 점은 이들이 집중하는 방향성의 차이다.
미국 휴머노이드 기업 피규어 AI(Figure AI)는 지난 17일 ‘헬릭스 2.5(Helix 2.5)’를 탑재한 휴머노이드를 처음 접하는 30개 가정에서 평가한 결과를 공개했다. 별도의 현장 학습 없이 집안일을 수행하는 제로샷 능력을 시험한 것이다. 18일 보도된 로이터 인터뷰에서는 중국 스피릿 AI(Spirit AI)가 휴머노이드가 자연어 지시를 이해하고 여러 물리적 행동을 수행하는 기술을 언급하며 2027년 중반께 큰 전환점을 맞을 수 있다는 전망을 내놨다.
경쟁의 초점은 단순한 로봇의 운동 능력에서 현실세계를 이해하고 새로운 작업에 대응하는 ‘두뇌’로 이동하고 있다. 이를 위해 기업들은 사람의 행동 데이터를 모으고 있으며, 피규어처럼 대규모 컴퓨팅 인프라 확보에 나선 사례도 등장하고 있다. 동시에 AI가 판단에 그치지 않고 실제 행동까지 수행하면서 안전 문제도 새로운 영역으로 확장되고 있다. 최근 구글 제미나이가 보안 평가 과정에서 실제 기업의 보호된 시스템에 접근한 사례는 로봇 사례는 아니지만, 목표와 도구를 부여받은 AI의 행동 범위를 어떻게 통제할 것인지라는 문제를 소프트웨어 영역에서 보여준다.
달리고 춤추는 로봇 다음은 ‘두뇌’…피지컬 AI로 옮겨간 경쟁

중국 베이징의 체화형 AI(Embodied AI) 스타트업 스피릿 AI 공동창업자 겸 수석과학자 가오양은 지난 17일 로이터 인터뷰에서 현재 로봇 기술의 상대적으로 약한 부분으로 ‘두뇌’를 꼽았다. 중국 휴머노이드 산업이 달리기와 춤, 공중제비 같은 운동 능력을 빠르게 끌어올렸지만 실제 경제적 가치를 만들기 위해서는 로봇이 환경을 이해하고 작업을 스스로 수행하는 능력이 필요하다는 설명이다.
가오양은 이를 로봇 산업의 ‘ChatGPT 모멘트’와 연결했다. 그는 2027년 중반을 이른바 ‘GPT-3.0 마일스톤’으로 표현하며, 사람이 자연어로 작업을 지시하면 로봇이 이를 이해하고 일련의 물리적 행동으로 옮기는 수준에 도달할 수 있다고 전망했다. 이는 현재 달성된 기술 수준이나 업계 공통의 기술 단계가 아니라 가오양이 향후 기술 발전을 설명하기 위해 제시한 전망이다.
현재 스피릿 AI는 구조화된 거실 환경의 단순 작업에서 자사 로봇이 약 90%의 성공률을 기록했다고 밝혔다. 미세한 조작이 필요한 병뚜껑 열기나 학습하지 않은 새로운 작업은 여전히 해결해야 할 과제로 남아 있다. 가오양은 산업 현장에서의 초기 활용은 향후 1~2년 사이 확대될 수 있지만, 가정에 본격적으로 들어가기까지는 최소 8년가량이 필요할 것으로 내다봤다.
사업화도 시작됐다. 스피릿 AI의 바퀴형 휴머노이드 ‘Moz1’ 수십 대는 배터리 업체 CATL과 전자상거래 기업 JD닷컴의 생산라인에서 가동되고 있다. 2024년 설립된 이 회사는 지금까지 6억7000만달러 이상을 조달했고 기업가치는 200억위안, 약 29억달러로 평가받고 있다.
미국에서는 피규어가 범용성을 시험하고 있다. 17일 공개한 헬릭스 2.5 평가에서 이를 적용한 휴머노이드는 샌프란시스코 베이 지역 30개 가정에서 거실 정리와 수건 접기, 침대 정리 등 세 가지 작업을 수행했다. 피규어는 해당 가정이나 그 안의 물체를 이용한 추가 데이터 수집이나 미세조정 없이 평가했다고 설명했다.
피규어가 자체 공개한 결과에서 인간 행동 데이터로 사전학습한 모델의 제로샷 성공률은 56%였다. 동일한 작업 데이터를 사용하면서 사전학습을 적용하지 않은 모델은 9%를 기록했다. 성공 여부는 부분 완료가 아니라 작업 전체를 마쳤을 때만 인정했다.
구글 딥마인드(Google DeepMind)도 앞서 지난 7월 30일 ‘제미나이 로보틱스 2(Gemini Robotics 2)’를 공개했다. 시각과 언어 입력을 실제 로봇 동작으로 변환하는 시각·언어·행동(Vision-Language-Action, VLA) 모델로, 휴머노이드의 이동부터 손을 이용한 물체 조작까지 전신을 제어하도록 설계됐다. 체화 추론 모델인 제미나이 로보틱스 ER 2는 여러 단계의 작업을 계획하고 진행 상황을 확인하며, 오류가 발생했을 때 작업을 수정하는 역할을 한다.
스피릿 AI와 피규어, 구글이 풀고 있는 공통 과제는 로봇이 학습 과정에서 접하지 않았던 환경과 작업에 어떻게 대응하느냐다. 정해진 동작을 정확하게 반복하는 산업용 로봇과 달리 범용 휴머노이드에는 새로운 상황에 기존 지식을 적용하는 능력이 요구된다.
인터넷 텍스트 대신 사람의 움직임…미·중 ‘현실세계 데이터’ 확보전

이런 범용성을 높이려면 물리세계에 특화된 데이터가 필요하다. 냉장고 문을 여는 방법이나 수건을 접을 때 손에 어느 정도 힘을 줘야 하는지, 좁은 공간에서 주변 물체와 충돌하지 않고 움직이는 방법처럼 텍스트만으로 학습하기 어려운 정보들이다.
스피릿 AI는 중국 전역에서 약 1000명의 작업자를 활용해 데이터를 수집하고 있다. 작업자들은 가정이나 공장에서 데이터 수집 장비를 착용하고 냉장고 열기, 금고 잠금 해제, 칼로 식재료 자르기 같은 행동을 반복한다. 스피릿 AI는 가상 시뮬레이션보다 실제 환경에서 얻은 데이터를 중시하고 있다. 단단한 물체는 시뮬레이션으로 비교적 잘 표현할 수 있지만 전선처럼 형태가 쉽게 변하는 물체와의 상호작용은 실제 데이터가 중요하다는 것이 가오양의 설명이다.
한편 피규어는 지난달 25일 ‘인덱스(Index)’를 공개했다. 전 세계 사용자가 일상생활과 작업 현장에서 수행하는 인간의 행동 영상을 수집해 헬릭스 학습에 활용하는 프로젝트다. 공개 당시 피규어는 108개국에서 26만4000건 이상의 앱 다운로드가 이뤄졌고, 1600만개 이상의 영상이 업로드됐다고 밝혔다. 수집 대상은 요리와 청소, 세탁뿐 아니라 물류센터와 식당, 공장, 사무실의 작업까지 포함된다.
대규모 모델 훈련을 위한 컴퓨팅 투자도 이어지고 있다. 피규어는 이어 지난 3일 AI 인프라 기업 엔스케일(Nscale)과 협력해 2027년 하반기부터 엔비디아 베라 루빈(Vera Rubin) 플랫폼 기반 GPU를 최대 10만개까지 배치한다는 계획을 발표했다. 초기 컴퓨팅 약정 규모는 35억달러이며 양측은 이를 향후 60억달러 이상으로 확대한다는 계획도 밝혔다. 피규어는 이를 차세대 헬릭스 모델 훈련에 활용할 예정이다.
중국의 유니트리(Unitree)도 범용성을 핵심 과제로 보고 있다. 왕싱싱 CEO는 지난달 베이징 세계로봇대회에서 현재 휴머노이드가 일부 조립 작업을 할 수 있지만 사람보다 효율이 낮고, 새로운 작업이 주어질 때마다 재학습이 필요하다는 점을 대규모 보급의 주요 장애물로 꼽았다.
미·중 경쟁을 ‘중국은 하드웨어, 미국은 소프트웨어’로 단순화하기는 어렵다. 스피릿 AI와 유니트리는 로봇용 AI 모델 개발에 집중하고 있고, 피규어 역시 자체 휴머노이드 하드웨어와 생산 역량을 확대하고 있다. 이번 사례들에서 차이가 있다면, 중국 기업들은 거대한 제조업 기반과 실제 생산 현장을 기술 검증에 활용하고 있고, 미국 기업들은 프런티어 AI 모델과 대규모 컴퓨팅 인프라를 적극 결합하고 있다는 점이다.
생성형 AI가 인터넷의 텍스트와 이미지를 기반으로 성장했다면 피지컬 AI 경쟁에서는 인간의 행동과 물체 간 상호작용을 담은 현실세계 데이터가 새로운 학습 자원으로 자리 잡고 있다.
AI가 판단만 하지 않고 ‘행동’한다면…안전의 경계도 달라진다

피지컬 AI가 주목받는 또 다른 이유는 모델의 판단이 현실세계의 행동으로 이어지기 때문이다. 직접적인 로봇 안전 사고 사례는 아니지만, 최근 구글 제미나이 사례는 목표와 도구를 부여받은 AI 에이전트의 행동 범위를 어떻게 제한할 것인지라는 문제를 보여준다.
사건은 지난 5월 독립 사이버보안 평가업체 이레귤러(Irregular)가 진행한 보안 능력 테스트 과정에서 발생했다. 제미나이 모델은 인터넷에서 공개 정보를 찾고 인증정보를 추측하거나 공개 저장소에 노출된 인증정보를 찾아, 테스트 범위에 포함돼 있다고 잘못 판단한 실제 기업 세 곳의 보호된 시스템에 접근했다. 한 사례에서는 비밀번호를 추측했고 다른 두 사례에서는 공개 저장소에서 찾은 인증정보를 이용했다.
구글 보안엔지니어링 부사장 헤더 애드킨스는 세 기업에 해당 사실을 알렸으며 평가 파트너와 함께 테스트 절차를 수정했다고 밝혔다. 세 사례 모두 제미나이는 이후 해킹 행동을 중단했다. 이레귤러도 문제를 수정했으며 메타와 앤트로픽, 오픈AI 평가 과정에서도 유사한 문제가 공개된 바 있다. 이를 AI가 독립적으로 통제를 벗어난 ‘폭주’로 볼 수는 없지만, 목표와 도구를 부여받은 AI가 작업 범위를 잘못 판단했을 때 실제 외부 시스템에 접근할 수 있다는 점은 확인됐다.
로봇 개발사들은 물리적 행동에 따른 위험에 별도의 안전장치를 적용하고 있다. 스피릿 AI는 로봇이 외부 환경과 상호작용하는 과정에서 일정 수준 이상의 힘을 감지하면 자동으로 긴급 제동하는 전신 힘 제어 기능을 기본 안전정책으로 두고 있다. 가오양은 현재 로봇용 AI 모델의 능력이 제한적이어서 통제를 벗어난 AI를 당장의 가장 시급한 위험으로 보지는 않았다. 다만 상업공간이나 가정처럼 사람이 많은 환경으로 활동 범위가 넓어지면 안전 문제의 중요성이 커질 것으로 봤다.
AI 개발 속도를 둘러싼 논의도 이어지고 있다. 앤트로픽 CEO 다리오 아모데이는 지난 12일 AI 모델 능력이 향상되는 속도를 늦출 필요가 있다며 독립적인 안전 평가자의 접근 확대와 프런티어 AI 기업 간 안전 기준 협력, 국제적인 위험 관리 등을 제안했다. 샘 올트먼 오픈AI CEO와 일론 머스크도 공개적으로 일부 취지에 동의했다.
한편 로이터는 지난 19일 복수의 관계자를 인용해 앤트로픽이 오픈AI의 ‘GPT-6 아스트라(GPT-6 Astra)’ 출시 이후 새로운 AI 모델의 출시 여부와 시점을 검토하고 있다고 보도했다. 출시 여부와 시기는 아직 확정되지 않았으며 앤트로픽은 차기 모델의 안전성 평가도 함께 진행 중인 것으로 전해졌다.
종합하면 이제까지 소프트웨어 에이전트에서 안전의 핵심이 네트워크와 파일, 계정에 대한 접근 권한이었다면 피지컬 AI에서는 이동 범위와 물체 조작, 접촉 강도 같은 요소까지 관리 대상이 된다. 스피릿 AI의 힘 제어처럼 모델의 판단을 실제 행동으로 옮기는 과정에서 별도의 기계적·소프트웨어적 안전장치가 필요한 이유다.
생성형 AI에서 치열해진 미·중 기술 경쟁은 이제 현실세계에서 직접 작업하는 AI로 영역을 넓히고 있다. 피규어와 구글, 스피릿 AI와 유니트리가 경쟁하는 대상도 단순한 로봇의 동작 성능이 아니다. 처음 보는 환경을 이해할 수 있는 모델, 이를 학습시킬 현실세계 데이터와 컴퓨팅 인프라, 실제 현장에 투입할 수 있는 로봇 생산 능력, 그리고 행동 범위를 통제하는 안전 기술이 함께 경쟁의 요소가 되고 있다.
