[위클리_피지컬AI] 피지컬 AI 기술 확보 위해 협력 나선 기업들 외
[IT동아 강형석 기자] 생성형 인공지능(AI)이 세상을 바꿨다면, 피지컬 AI(실물 인공지능)는 세상을 뒤흔들 것으로 전망된다. 생성형 AI는 온라인상에서 원하는 결과물을 얻고 창의적인 활동을 가능케 하지만, 피지컬 AI는 산업현장부터 일상환경, 재해극복까지 사람이 하기 어려운 영역을 폭넓게 풀어낼 잠재력을 지녔기 때문이다. 현재 전 세계 기술 기업들이 피지컬 AI 경쟁에 뛰어들었고, 기술 개발도 활발하게 이어진다. [위클리_피지컬AI]는 지난 한 주간 주목받은 기술 기업 소식과 연구 성과를 다루고자 한다.
애질리티 로보틱스, 로봇 안전 확보 위한 행보에 나서
산업용 로봇팔은 고정된 자리에서 정해진 동작을 반복한다. 반면 휴머노이드처럼 자유롭게 움직이는 로봇은 주변 사람, 사물과 접촉할 가능성이 크다. 그만큼 안전 확보가 중요해진다. 사람과 같은 공간에서 일하려면 매번 달라지는 현장 상황에 스스로 대응하는 시스템이 필요하다. 부품, 생산 설비, 현장 운영, 규제, 작업 안전, 데이터 관리가 빈틈없이 맞물려야 하는 까닭이다.
2026년 10월 1일, 애질리티 로보틱스(Agility Robotics)와 포트 로보틱스(FORT Robotics)가 로봇 안전 기술을 함께 개발하기로 했다. 개발한 기술은 휴머노이드 로봇 디지트 5(Digit 5)에 적용될 예정이다.

첫 번째는 오프보드 세이프티 브리지(Offboard Safety Bridge)다. 로봇 본체에 들어가는 사람 감지, 경고 신호, 안전한 동작 제어 같은 온보드(로봇 내장) 기능을 보완하는 역할을 맡는다. 안전을 로봇 혼자 책임지게 하지 않고, 주변 설비와 연동해 함께 지키는 구조까지 포함한다.
두 번째는 안전 펜던트다. 비상 정지 버튼과 비상 해제 스위치(누르고 있는 동안에만 로봇이 반응하는 스위치)를 하나로 합친 휴대용 단말이다. 설비를 설치하거나 정비하는 중, 혹은 예상 밖 상황이 닥쳤을 때 사람이 직접 로봇을 제어하는 보조 수단으로 쓰인다. 애질리티 로보틱스가 2026년 초 태블릿 거치대 형태의 장비인 펜던트 슬레드를 주문 제작한 만큼, 안전 펜던트가 이 장비와 연동될 가능성도 거론된다. 양사는 하드웨어 개발, 솔루션 엔지니어링, 규제 대응, 현장 배치 지원 등으로 협력 범위를 넓힐 방침이다.
이번 행보는 휴머노이드를 완제품 하나로 파는 데서 나아가 안전, 소프트웨어, 서비스, 제조 공급망을 묶은 플랫폼으로 키우려는 시도로 읽힌다. 사업 성과에 따라 애질리티 로보틱스의 전략 방향에도 영향을 미칠 전망이다.
캐터필러, 코어위브와 협력해 중장비용 피지컬 AI 학습에 속도 낸다
2026년 10월 6일, 중장비 기업 캐터필러(Caterpillar)와 클라우드 컴퓨팅 기업 코어위브(CoreWeave)가 대형 건설 중장비용 피지컬 AI 가속 전략을 공개했다. IT 미디어 실리콘앵글(SiliconANGLE)에 따르면 두 기업은 중장비의 자율 운용에 필요한 AI 학습 피드백 루프(결과를 점검해 다시 학습에 반영하는 순환 과정)를 수개월 단위에서 몇 시간 단위로 줄이는 공동 파이프라인을 구축했다.
캐터필러는 최근 AI 전환에 힘을 쏟고 있다. 현장 기술자가 중장비 앞에서 데이터를 확인하고 다양한 상황에 대응하도록 돕는 AI 도구 'CAT AI 어시스턴트(CAT AI Assistant)'의 적용 범위를 넓히는 중이다. 2026년 6월에는 필드 AI(Field AI)와 손잡고 자율 주행과 로봇 제어 기술 확보에도 나섰다. 코어위브와의 협력은 현장과 데이터센터를 하나로 잇고 업무 효율을 끌어올리려는 시도다.

요즘 중장비에는 라이다(LiDAR, 레이저로 거리를 재는 센서), 컴퓨터 비전 카메라, 유압 텔레메트리 센서(유압 장치의 상태를 원격으로 측정하는 센서) 등이 탑재된다. 이렇게 모인 현장 데이터는 피지컬 AI 학습에 쓰이지만, 종류가 다양하고 구조가 복잡해 분석과 학습에 시간이 오래 걸린다. 캐터필러는 코어위브의 고성능 클라우드 컴퓨팅 자원을 활용해 학습 시간을 줄이고, 차세대 기술 개발에 속도를 낼 수 있게 됐다.
실리콘앵글은 코어위브가 고객사의 분야별 전문가와 엔지니어를 직접 연결하는 피지컬 AI 필드 엔지니어링 전담 조직을 투입했다고 전했다. 이 조직이 자동화된 데이터 라벨링(AI가 학습할 수 있도록 데이터에 정답 표시를 붙이는 작업) 파이프라인을 가동하고 분산 GPU 클러스터(여러 대의 GPU를 묶은 연산 시스템)를 최적화하면서, 데이터 수집부터 모델 배포까지 걸리는 주기를 크게 단축했다는 설명이다.
두 기업의 협력은 AI 클라우드 컴퓨팅(데이터센터) 업체가 기업용 엔터테인먼트, AI 에이전트, 검색 시장을 넘어 중공업과 제조 인프라로 영역을 넓힐 수 있음을 보여주는 사례가 될 전망이다.
로봇의 예측에 깊이를 더하는 ‘뎁스월드’
피지컬 AI 업계가 주목하는 기술 중 하나는 월드모델이다. 로봇이 어떻게 움직이느냐에 따라 세상이 어떻게 바뀔지 미리 시뮬레이션해 보는 AI 모델이다. 사람이 공을 던지기 전에 머릿속으로 궤적을 그려 보듯, 신경망이 앞으로 벌어질 카메라 영상을 먼저 생성해 보고 가장 알맞은 행동을 고른다. 다만 기존 월드모델은 평면적인 2차원 컬러(RGB) 화소의 변화만 예측하도록 훈련돼, 실제 상황을 정확히 판단하기 어렵다는 한계가 있었다.
체코공과대학교 산하 국립 연구소(CIIRC)와 프랑스 국립디지털과학연구소(Inria)의 자이 바르단(Jai Bardhan), 요제프 시빅(Josef Sivic), 블라디미르 페트릭(Vladimir Petrik) 연구진은 이 한계를 넘을 대안으로 뎁스월드(DepthWorld)를 제안했다. 연구진이 내놓은 해법은 크게 두 가지다.
첫 번째는 '드로이드(DROID)-3D' 캘리브레이션(측정값 보정) 파이프라인이다. 전 세계 연구진이 이미 모아 둔 방대한 로봇 원격 조종 데이터를 사후에 3차원 정밀 좌표로 되살리는 방식이다.

대상은 7만 개 이상의 에피소드를 담은 오픈 데이터셋 드로이드다. 연구진은 로봇의 관절 각도를 재는 인코더 값과 카메라 영상을 하나의 결합 팩터 그래프(Joint Factor Graph, 여러 변수를 표현하는 이분 그래프)로 묶고, 같은 기체에서 나온 모든 영상 에피소드를 한 번에 최적화했다. 그 결과 카메라 설치 위치의 미세한 흔들림과 관절의 영점 오차(기준 각도가 어긋난 정도)를 거의 바로잡았다는 설명이다.
연구진은 정밀 체커보드(ChArUco)로 측정했더니, 기존 방식은 카메라의 위치와 방향 값에서 72mm, 3.0도의 오차가 났다. 새 기법은 이를 4.9mm, 0.39도로 줄였고, 관절 7개의 평균 오프셋 오차도 0.14도 수준으로 낮췄다.
두 번째는 모델 구조의 최적화다. 3차원 깊이(Depth) 정보를 모델에 넣을 때는 보통 신경망의 입력 채널을 늘리거나 깊이 예측용 보조 신경망을 덧붙인다. 하지만, 이 방식은 모델의 가중치(학습된 값)를 무작위로 다시 초기화해야 한다. 인터넷의 수십억 편에 달하는 영상으로 미리 익혀 둔 물리적 상식과 시각적 사전 지식이 훼손될 수 있다는 뜻이다.
연구진은 사전 학습된 변형 오토 인코더(VAE, 영상을 압축해 표현하는 신경망)가 깊이 지도의 공간 정보도 잘 압축한다는 점에 착안했다. 이를 바탕으로 컬러 영상과 깊이 지도를 좌우로 나란히 이어 붙이는 '공간 잠재 타일링(Spatial Latent Tiling)' 기법을 도입했다. 신경망에 가한 구조적 수정은 넓어진 화면 격자를 소화하도록 위치 임베딩(화면 속 위치를 알려주는 정보)을 확장한 것이 전부다. 덕분에 사전 학습된 스테이블 비디오 디퓨전(Stable Video Diffusion)의 가중치를 지킬 수 있었다는 설명이다.
같은 학습 비용과 연산 자원을 투입했을 때 성능 차이도 확인됐다. 외부 카메라 시점의 최대 신호 대 잡음비(PSNR, 생성 영상이 실제 영상과 얼마나 비슷한지 나타내는 수치로 높을수록 정확하다)는 뎁스월드가 24.09dB(데시벨)로, 컬러 기반 월드모델의 22.63dB보다 높았다. 로봇 손목 카메라 시점에서도 16.98dB에서 17.96dB로 올랐다. 3차원 공간의 깊이를 이해하도록 만들자 표면의 질감, 경계선, 그림자의 이동을 물리 법칙에 맞게 계산하는 능력까지 함께 좋아진 것이다.
피지컬 AI 업계는 저마다 최적화된 학습 데이터를 구축하는 데 역량을 모으고 있다. 물체를 쥐고 문을 밀어 열어야 하는 물리적 상호작용이 필요하기 때문이다. 그러나 상호작용의 핵심인 공간 정보와 사물 간 거리를 제대로 처리하지 못하면 오동작으로 이어진다. 뎁스월드는 그동안 활용도가 낮았던 원격 조종 영상 데이터를 정밀한 3차원 데이터로 되살릴 수 있음을 보여준 연구다.
IT동아 강형석 기자 (redbk@itdonga.com)

