Skild AI, Nvidia 기술 활용해 단 한 편의 영상으로 로봇에 새 작업 학습시켜
미국 피츠버그 스타트업 Skild AI가 단 한 편의 시연 영상만으로 로봇이 복잡한 물리적 워크플로를 습득할 수 있는 파운데이션 모델 'S1'을 배포하고, 연환산 매출 1억 달러를 달성했다.

단 한 편의 시연 영상으로 로봇에 복잡한 작업 학습시켜
미국 피츠버그 기반의 로봇 스타트업 Skild AI가 단 한 편의 시연 영상만으로 복잡한 다단계 작업을 학습하도록 설계된 피지컬 AI 파운데이션 모델 'S1'을 공개했다. Nvidia의 지원을 받는 이 회사는 자동화 시스템을 연구실에서 실제 생산 현장으로 이전하는 데 필요한 시간과 프로그래밍 작업을 대폭 단축함으로써 범용 로봇 공학을 정조준하고 있다.
이번 상용화 출시는 Skild AI가 초기 상업 배포에 나선 지 불과 10개월 만에 연환산 매출(ARR) 1억 달러를 돌파하며 주요 재무적 이정표를 달성한 시점에 이뤄졌다.
휴스턴 공장 배포와 S1 아키텍처
Skild의 기술은 이미 실제 생산 라인에 적용되고 있다. 미국 휴스턴에 위치한 Nvidia 제조 시설에서 Skild와 Nvidia, 그리고 전자제품 제조사 Foxconn은 전신(omni-bodied) 파운데이션 모델인 'Skild Brain'으로 구동되는 양팔 로봇을 활용해 Nvidia Blackwell GPU 시스템을 조립하고 있다.
S1 모델은 Nvidia의 소프트웨어 및 컴퓨팅 인프라를 기반으로 개발됐으며, 데이터 생성, 시뮬레이션, 모델 훈련 및 배포를 처리하기 위해 Cosmos, Isaac Sim, Isaac Lab, Omniverse를 활용했다. 현장에 배포된 시스템은 위치가 바뀐 물품에 자율적으로 적응하고, 작업 오류를 스스로 복구하며, 명시적으로 프로그래밍되지 않은 순서로도 여러 동작을 유기적으로 연결해 수행할 수 있다.
한 시험 주행에서 Skild는 화분에 식물을 심는 사람의 모습을 영상으로 촬영한 지 불과 11분 만에 로봇이 해당 작업을 자율적으로 재현하는 모습을 선보였다.
Amit Goel Nvidia 오토노머스 머신 부문 제품 관리 총괄은 "S1은 작업자가 로봇에게 새로운 작업을 얼마나 신속하게 가르칠 수 있는지 보여준다"며 "제조업체 입장에서는 제품, 부품 및 공정이 바뀌더라도 자동화 시스템을 훨씬 더 유연하게 적응시킬 수 있는 기회"라고 밝혔다.
피지컬 AI의 데이터 및 구현 과제 해결
파운데이션 모델의 비약적인 발전에도 불구하고, 피지컬 AI는 실제 환경의 훈련 데이터를 수집하기 어렵다는 제약에 여전히 직면해 있다. 인터넷에서 텍스트나 코드를 수집하는 디지털 AI 시스템과 달리, 로봇 시스템은 조명 변화, 물체 배치, 촉각 피드백, 예측 불가능한 예외 상황(edge cases) 등을 능숙하게 다룰 수 있어야 한다.
Goel 총괄은 "실제 로봇을 통해 이러한 경험 데이터를 수집하는 것은 느리고 비용이 많이 든다"고 지적하며, Cosmos를 통한 합성 데이터 생성과 함께 Isaac Lab, Omniverse와 같은 시뮬레이션 플랫폼이 핵심적인 대안이라고 강조했다. 다만 시뮬레이션을 거친 테스트 결과가 공장 현장에서 신뢰할 수 있는 성능으로 정확하게 이어지도록 하는 것은 지속적인 과제로 남아 있다.
개발자들은 향후 다양한 형태의 로봇을 구동할 수 있는 공유 파운데이션 모델 구축을 목표로 하고 있다. Skild AI는 로봇 팔, 4족 보행 로봇, 휴머노이드 플랫폼 전반에 걸쳐 자사 모델을 구동해 왔다. Goel 총괄에 따르면, 다양한 기계 본체와 공장 작업 전반에 걸쳐 재사용 가능한 기계 지능을 구축하는 것이 물리적 자동화 분야의 다음 핵심 마일스톤이 될 전망이다.



