Sean Woo · Robotics & AI Editor
- 모방학습은 시범 데이터를 이용해 상황에 맞는 행동을 배우는 방법입니다.
- 사람이 로봇을 원격조작해 시범을 모으는 단계와, 학습한 로봇이 스스로 움직이는 단계는 다릅니다.
- 카메라 영상뿐 아니라 관절 위치·동작 기록을 함께 쓰는 방식이 있습니다.
- 특정 실험에서 잘했다고 낯선 집이나 공장에서도 같은 성공률이 나오는 것은 아닙니다.
- 시범의 양과 함께 다양한 상황, 실패 복구, 사람의 개입 횟수를 살펴봐야 합니다.
로봇의 모방학습(Imitation Learning)은 사람이 보여준 시범 등을 바탕으로, 지금 상황에서 어떤 행동을 할지 배우는 방법입니다. 로봇팔이 컵을 집는 모습을 보면서 “저 동작은 누가 하나하나 입력했을까?”라는 생각이 들 수 있습니다. 모방학습에서는 시범이 그 동작을 가르치는 자료가 됩니다.
이 글은 새로운 제품 발표가 아닌 용어 해설입니다. 아래의 연구 사례는 발표 당시 실험 조건을 기준으로 설명합니다.

쉽게 말하면: 선생님의 시범을 행동 교과서로 만듭니다
아이가 어른을 보고 컵을 쟁반에 옮기는 장면을 떠올려 보세요. 컵을 향해 손을 뻗고, 잡고, 들어 올린 뒤 내려놓습니다. 로봇도 시범에서 행동의 단서를 얻을 수 있습니다.
다만 사람처럼 눈으로 한 번 보고 모든 원리를 이해한다는 뜻은 아닙니다. 로봇 연구에서는 사람이 조종 장치를 움직여 로봇을 원격조작하고, 그때의 카메라 영상과 로봇 상태·행동을 함께 기록하기도 합니다. 2023년 ALOHA 연구가 이런 접근의 사례입니다.
이 비유의 한계도 있습니다. 로봇은 사람과 손 모양, 관절, 힘을 주는 방식이 다릅니다. 사람의 일반 영상만으로 로봇의 정확한 제어 명령이 곧바로 만들어지는 것은 아닙니다.
원격조작과 모방학습, 자율 수행은 어떻게 다를까요?
| 구분 | 무엇을 하는 단계인가요? | 확인할 점 |
|---|---|---|
| 원격조작 | 사람이 조종 장치로 로봇의 움직임을 이끕니다. | 시범 수집인지, 실제 서비스 중 조작인지 |
| 모방학습 | 모아둔 시범에서 상황과 행동의 관계를 학습합니다. | 어떤 상황을 얼마나 다양하게 담았는지 |
| 학습 후 자율 수행 | 학습한 모델이 관측을 바탕으로 행동을 출력합니다. | 사람 개입 없이 끝냈는지, 실패 시 누가 복구했는지 |
따라서 사람이 조종하며 데이터를 모았다는 사실만으로 최종 로봇이 원격조작 전용이라고 할 수는 없습니다. 반대로 매끄러운 시연 영상만 보고 완전 자율이라고 판단해서도 안 됩니다. ALOHA 연구도 원격조작 시스템과 학습한 모델의 실행을 나누어 설명합니다.
로봇은 어떤 자료를 배우나요?
대표적인 방식인 행동 복제(Behavior Cloning)는 관측된 상황에서 시범과 비슷한 행동을 출력하도록 학습합니다. 예를 들면 “컵이 이 위치에 있고 팔은 이 자세일 때, 다음에는 이렇게 움직였다”라는 자료를 이용하는 것입니다.
ALOHA의 ACT 모델은 여러 카메라 영상과 관절 위치 등을 바탕으로 한 번의 동작 대신 여러 동작의 묶음을 예측합니다. 연구 페이지에는 실행 관측용 RGB 카메라가 4대이며, 2대는 고정되고 2대는 손목에 부착됐다고 설명돼 있습니다. 이는 해당 시스템의 구성이지 모든 모방학습 로봇의 필수 규격은 아닙니다. 근거: ALOHA의 Learning Algorithm·Observations 항목
실제 숫자를 볼 때는 실험 조건을 같이 봐야 합니다
ALOHA 연구 페이지의 네 가지 작업 시연 설명에는 작업마다 시범 50회를 학습에 사용했다고 나옵니다. 학습과 시험에서는 물체 위치를 15cm 기준선을 따라 무작위로 바꿨으며, 네 작업의 성공률은 각각 96%, 84%, 64%, 92%로 보고했습니다.
이 수치는 “모방학습 로봇은 어디서나 90% 이상 성공한다”는 뜻이 아닙니다. 특정 장비·작업·위치 변화 조건에서 연구진이 얻은 결과입니다. 여기서는 네 작업을 합친 단일 성공률을 계산하지 않으며, 낯선 가정이나 공장의 성능으로 확대하지 않습니다. 근거: ALOHA의 Learning Algorithm 실험 설명
데이터를 더 넓게 모으려는 시도도 있습니다. Open X-Embodiment 프로젝트는 22종의 로봇 형태에서 얻은 100만 개 이상의 실제 로봇 작업 궤적을 소개합니다. 궤적은 작업 중 이어지는 관측·행동의 기록을 뜻하며, 사진 100만 장이나 로봇 100만 대를 의미하지 않습니다. 이것 역시 이 프로젝트의 데이터 규모로, 특정 제품의 판매·설치 실적이 아닙니다. 근거: Open X-Embodiment Dataset Overview
시범을 잘 따라 했는데도 왜 실패할까요?
컵을 잡는 위치가 조금 어긋나면 다음 장면도 시범과 달라집니다. 이어서 팔을 움직이면 오차가 더 커질 수 있습니다. 자신의 행동 때문에, 학습할 때 자주 보지 못한 상황에 들어가는 문제입니다.
2011년 DAgger 논문은 이런 순차적 의사결정에서 이전 행동이 다음 관측에 영향을 준다는 문제를 다룹니다. 연구가 오래됐다는 사실과 별개로, 시범 데이터에서 잘 맞추는 것만으로 실제 실행을 보장하기 어렵다는 점을 이해하는 데 도움이 됩니다. 근거: Ross·Gordon·Bagnell, 2011
실패가 이어지는 영향을 가상의 숫자로 살펴볼 수도 있습니다. 각 단계의 성공확률이 서로 독립이고 모두 99%이며, 실패 복구 없이 20단계를 전부 성공해야 한다고 가정하면 전체 성공확률은 0.99의 20제곱, 약 81.8%입니다. 실제 로봇 성능을 측정한 결과가 아니라, 작은 실패 가능성이 긴 작업에서 누적되는 효과를 보여주는 계산 예시입니다.
기술과 사업에서는 무엇을 확인해야 할까요?
ITTimes의 해석은 이렇습니다. 모방학습의 사업적 가치를 판단하려면 멋진 성공 장면과 데이터 수집 시간에 더해 새로운 환경에 적응하는 비용과 운영 중 필요한 사람의 도움을 확인해야 합니다.
- 시험 범위: 물건·조명·배치가 학습 때와 얼마나 달랐나요?
- 완료 기준: 한 동작이 아니라 전체 작업을 끝냈나요?
- 사람 개입: 조종·재시작·물건 재배치가 몇 번 필요했나요?
- 실패 복구: 놓친 물건을 스스로 다시 잡았나요?
- 추가 학습 비용: 새 작업마다 시범 수집과 조정에 얼마나 시간이 드나요?
확인되지 않은 값은 0이나 “문제없음”으로 채울 수 없습니다. 모방학습은 로봇에게 행동을 가르치는 유력한 방법이며, 현장에서 안정적으로 일하는지는 별도의 운영 평가가 필요합니다.
함께 읽으면 좋은 글
확인한 원문
원문 확인일: 2026.09.13 (한국시간)
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware — RSS 2023 연구 프로젝트. 원격조작·ACT·시범 횟수·실험 조건.
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models — 데이터 개요와 로봇 형태·작업 궤적 규모.
- A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning — PMLR 15, 627–635쪽, 2011. 순차 행동에서의 관측 분포 문제.
Sean Woo | Robotics & AI Editor
15년 이상 로보틱스 기술·사업 방향성 수립 업무를 해왔습니다. 공개된 기술문서·논문·기업 발표를 바탕으로 로봇과 AI의 변화를 이해하기 쉽게 분석합니다. 이 매체의 해석은 특정 회사나 기관의 공식 입장을 대변하지 않습니다.