한국어

SmolVLA

현대 로보틱스를 위한 오픈 소스 시각-언어-행동 모델

SmolVLA란?

작지만 강력함

SmolVLA는 21억 개의 파라미터를 가진 최첨단 시각-언어-행동(VLA) 모델로, 실제 로보틱스 작업에서 뛰어난 성능을 발휘하도록 설계되었습니다.

고효율

소비자용 GPU에 최적화되어 NVIDIA RTX 3090과 같은 접근 가능한 하드웨어에서 실시간 작동을 가능하게 하는 인상적인 추론 속도를 달성합니다.

개방적이고 접근 가능함

Hugging Face에서 개발하고 오픈 소스로 공개한 SmolVLA는 로보틱스 연구의 민주화를 목표로 하며, 고급 VLA 기술을 모두가 이용할 수 있도록 합니다.

실행 모습 보기

실제 환경에서 다양한 작업을 수행하며 그 능력을 보여주는 SmolVLA를 시청하세요.

SmolVLA 개요

커뮤니티 DIY 로봇 비디오

🚀 SmolVLA 소개

SmolVLA는 Hugging Face가 개발한 4억 5천만 개의 파라미터만을 가진 획기적인 Vision-Language-Action(VLA) 모델입니다. 소비자급 하드웨어에서 비용 효율적인 배포를 위해 신중하게 설계되어 고급 로봇 기술을 더 많은 개발자와 애호가들이 이용할 수 있게 합니다.

오픈 커뮤니티 LeRobot 데이터셋으로 훈련된 SmolVLA는 대규모 독점 모델과 동등하거나 더 우수한 성능으로 오픈 소스 협업의 힘을 진정으로 구현합니다.

공식 연구 논문

기술적 세부 사항에 대한 심층적인 내용은 공식 연구 논문을 읽어보세요. 모델 아키텍처, 훈련 방법론, 성능 벤치마크에 대한 포괄적인 정보를 제공합니다.

🛠️ 빠른 시작 가이드

📋 모델 개요

SmolVLA는 저렴하고 효율적인 로봇공학을 위해 설계된 4억 5천만 파라미터 vision-language-action 모델입니다. 경쟁력 있는 성능을 유지하면서 소비자 하드웨어에서 실행되도록 최적화되어 있습니다.

파라미터: 450M
다운로드: 지난 달 15,383+
미세 조정 모델: 29개 모델

1. 환경 설정

계속하기 전에 문서의 설치 가이드에 따라 환경을 적절히 설정해야 합니다.

git clone https://github.com/huggingface/lerobot.git
cd lerobot
pip install -e ".[smolvla]"

2. 사전 훈련된 모델 로드

SmolVLA를 경험하는 가장 빠른 방법은 Hugging Face에서 사전 훈련된 모델을 직접 로드하는 것입니다.

from lerobot.common.policies.smolvla.modeling_smolvla import SmolVLAPolicy
policy = SmolVLAPolicy.from_pretrained("lerobot/smolvla_base")

3. 사전 훈련된 모델 미세 조정

특정 사용 사례에 맞게 SmolVLA를 미세 조정할 수 있습니다. 자세한 내용은 문서를 참조하세요.

# 구성 파일 준비
config_path = "path/to/your/config.yaml"

# 훈련 시작
python lerobot/scripts/train.py \
  --config-path $config_path \
  --resume-from lerobot/smolvla_base

4. 모델 평가

다양한 로봇 작업에서 모델을 테스트하세요.

python lerobot/scripts/eval.py \
  --policy-path outputs/train/smolvla/checkpoints/last \
  --env-name aloha_sim_insertion_human

📊 추가 리소스

🤝 커뮤니티 미세 조정 모델

커뮤니티가 구축한 놀라운 애플리케이션을 발견하세요! 이러한 29개의 미세 조정 모델은 다양한 로봇 작업에서 SmolVLA의 다재다능함을 보여줍니다.

전체 29개 커뮤니티 모델 둘러보기 →

📊 훈련 데이터셋 탐색기

SmolVLA는 고품질 Open-X-Embodiment (OXE) 데이터셋으로 훈련되었습니다. 훈련 데이터 탐색:

📦 데이터셋 통계

  • 총 궤적: 1.4M+
  • 로봇 플랫폼: 10+개의 다양한 구현
  • 작업: 픽 앤 플레이스, 조작, 내비게이션
  • 데이터 형식: LeRobot 호환

Hugging Face에서 데이터셋 탐색 →

커뮤니티 쇼케이스

커뮤니티가 SmolVLA를 새롭고 흥미로운 애플리케이션에 어떻게 활용하고 적용하는지 확인해 보세요.

리소스

❓ 자주 묻는 질문

LeRobot 로봇 팔에서 SmolVLA를 사용할 때 자주 묻는 질문에 대한 답변입니다.

학습에 어떤 물체를 사용할 수 있나요? 크기가 중요한가요? 직육면체도 되나요?
엄격한 규격은 없습니다. 그리퍼로 집을 수 있고 카메라에 뚜렷하게 보이는 물체라면 무엇이든 괜찮습니다. 튜토리얼에서는 SO-100/SO-101 팔과 함께 약 2~4cm 크기의 작은 정육면체를 자주 사용하며, 직육면체나 다른 형태도 괜찮습니다. 중요한 것은 일관성입니다. 데이터 수집과 실행 시 같은 물체를 사용하고, 위치와 방향을 다양하게 바꿔 데이터를 모으면 정책의 일반화 성능이 좋아집니다.
손목(그리퍼) 카메라 없이 SmolVLA를 사용할 수 있나요?
가능합니다. SmolVLA는 데이터셋을 기록할 때 사용한 카메라 구성에 적응하므로, 고정된 외부 카메라 하나만으로도 동작할 수 있습니다. 다만 손목 카메라는 조작 중 물체를 가까이에서 볼 수 있어 대개 파지 정확도를 높여 줍니다. 어떤 구성을 쓰든 학습과 실행 시 카메라 구성을 완전히 동일하게 유지하세요.
카메라 마운트 같은 3D 프린팅(STL) 파일은 어디에서 구하나요?
LeRobot과 함께 쓰는 SO-100/SO-101 팔은 오픈 하드웨어로, 프린팅 가능한 STL/CAD 파일은 GitHub의 SO-ARM100 저장소(TheRobotStudio)에 있습니다. 커뮤니티에서 만든 카메라 마운트는 Printables/Thingiverse에 공유되는 경우가 많습니다. 최신 링크는 LeRobot 하드웨어 문서를 확인하세요.
학습된 정책을 라즈베리 파이/엣지 기기에서 실행할 수 있나요?
SmolVLA는 가볍고(약 4억 5천만 파라미터) 평범한 하드웨어에서도 동작하지만, 라즈베리 파이 CPU만으로 실시간 추론을 하면 느립니다. 권장되는 방식은 SmolVLA의 비동기 추론으로, 행동 예측과 실행을 분리합니다. 정책은 더 성능 좋은 머신(원격도 가능)에서 실행하고 로봇은 부드럽게 동작합니다. 기기에서 실시간 제어를 하려면 소형 GPU/가속기를 쓰는 것이 좋습니다.
데이터를 기록하지 않고 학습된 정책을 '실행'만 하려면 어떻게 하나요?
LeRobot에서는 평가/추론 스크립트로 학습된 정책을 실행하고 데이터셋을 저장하지 않으면 됩니다. 기록 루프를 재사용하는 이유는 로봇 제어를 담당하기 때문이며, 출력을 임시 디렉터리로 지정(이후 삭제)하거나 전용 평가/추론 명령을 사용할 수 있습니다. CLI는 버전마다 바뀌므로 정확한 명령 이름은 최신 LeRobot 문서를 확인하세요.
어느 정도의 기술 수준이 필요한가요? 복사·붙여넣기로 실행되나요?
표준 SO-100/SO-101 워크플로에서는 대체로 '명령을 따라 하는' 수준이며, 파인튜닝이나 제공된 스크립트 실행에 깊은 ML 프로그래밍은 필요 없습니다. 다만 Python과 명령줄의 기본 사용법, 그리고 하드웨어 조립·보정과 드라이버/USB 문제 해결을 위한 인내심은 필요합니다. 시작하는 데 직접 모델 코드를 작성할 필요는 없습니다.
정육면체를 같은 위치에 둬야 한다면, 고정 궤적을 재생하면 되지 왜 AI를 쓰나요?
고정 궤적은 매번 모든 것이 정확히 같은 위치에 있을 때만 작동하며 변화에 적응하지 못합니다. 학습된 VLA 정책은 카메라 영상을 활용해 물체의 위치·방향·조명 변화에 대응하고, 다양한 언어 명령도 따를 수 있습니다. 튜토리얼에서 위치를 고정하는 것은 첫 시연을 단순하게 하기 위해서일 뿐이며, SmolVLA의 진짜 가치는 일반화에 있고 이는 다양한 데이터로 학습해야 얻어집니다.