日本語

SmolVLA

現代ロボティクスのためのオープンソース視覚言語行動モデル

SmolVLAとは?

コンパクト&パワフル

SmolVLAは、21億のパラメータを持つ最先端の視覚言語行動(VLA)モデルで、実際のロボティクス課題で卓越したパフォーマンスを発揮するように設計されています。

高効率

コンシューマー向けGPUに最適化されており、NVIDIA RTX 3090などの手頃なハードウェアでリアルタイム操作を可能にする驚異的な推論速度を実現します。

オープン&アクセシブル

Hugging Faceによって開発され、オープンソースとして公開されたSmolVLAは、ロボティクス研究の民主化を目指し、高度なVLA技術を誰もが利用できるようにします。

実際の動作を見る

SmolVLAが実際の環境でさまざまなタスクを実行し、その能力を披露する様子をご覧ください。

SmolVLAの概要

コミュニティによるDIYロボットビデオ

🚀 SmolVLAとは

SmolVLAは、Hugging Faceが開発した、わずか4億5000万パラメータの画期的なVision-Language-Action(VLA)モデルです。コンシューマーグレードのハードウェアでのコスト効率的な展開を目的として慎重に設計されており、より多くの開発者や愛好家が先進的なロボット技術にアクセスできるようになっています。

オープンコミュニティのLeRobotデータセットでトレーニングされたSmolVLAは、オープンソースコラボレーションの力を真に体現しており、大規模な独自モデルと同等またはそれ以上のパフォーマンスを発揮します。

公式研究論文

技術的な詳細については、公式研究論文をお読みください。モデルアーキテクチャ、トレーニング手法、パフォーマンスベンチマークに関する包括的な情報を提供しています。

🛠️ クイックスタートガイド

📋 モデル概要

SmolVLAは、手頃な価格で効率的なロボティクスのために設計された4億5000万パラメータのvision-language-actionモデルです。競争力のあるパフォーマンスを維持しながら、コンシューマーハードウェアで動作するように最適化されています。

パラメータ: 450M
ダウンロード: 先月15,383+
ファインチューンモデル: 29モデル

1. 環境セットアップ

続行する前に、ドキュメントのインストールガイドに従って環境を適切にセットアップする必要があります。

git clone https://github.com/huggingface/lerobot.git
cd lerobot
pip install -e ".[smolvla]"

2. 事前トレーニング済みモデルの読み込み

SmolVLAを体験する最も速い方法は、Hugging Faceから事前トレーニング済みモデルを直接読み込むことです。

from lerobot.common.policies.smolvla.modeling_smolvla import SmolVLAPolicy
policy = SmolVLAPolicy.from_pretrained("lerobot/smolvla_base")

3. 事前トレーニング済みモデルのファインチューン

特定のユースケースに合わせてSmolVLAをファインチューンできます。詳細はドキュメントを参照してください。

# 設定ファイルを準備
config_path = "path/to/your/config.yaml"

# トレーニングを開始
python lerobot/scripts/train.py \
  --config-path $config_path \
  --resume-from lerobot/smolvla_base

4. モデルの評価

さまざまなロボットタスクでモデルをテストします。

python lerobot/scripts/eval.py \
  --policy-path outputs/train/smolvla/checkpoints/last \
  --env-name aloha_sim_insertion_human

📊 追加リソース

🤝 コミュニティファインチューンモデル

コミュニティが構築した素晴らしいアプリケーションを発見しましょう!これらの29のファインチューンモデルは、さまざまなロボットタスクにおけるSmolVLAの汎用性を示しています。

全29コミュニティモデルを閲覧 →

📊 トレーニングデータセットエクスプローラー

SmolVLAは高品質なOpen-X-Embodiment(OXE)データセットでトレーニングされました。トレーニングデータを探索:

📦 データセット統計

  • 総軌跡数: 1.4M+
  • ロボットプラットフォーム: 10+の異なる実装
  • タスク: ピック&プレース、マニピュレーション、ナビゲーション
  • データ形式: LeRobot互換

Hugging Faceでデータセットを探索 →

コミュニティショーケース

コミュニティがSmolVLAを新しいエキサイティングなアプリケーションにどのように使用し、適応させているかをご覧ください。

リソース

❓ よくある質問

LeRobot ロボットアームで SmolVLA を使う際のよくある質問への回答です。

学習にはどんな物体を使えますか?大きさに決まりはありますか?直方体でもよいですか?
厳密な決まりはありません。グリッパーで掴めて、カメラにはっきり写る物体であれば何でも構いません。チュートリアルでは SO-100/SO-101 アームと一緒に 2〜4cm ほどの小さな立方体がよく使われますが、直方体やその他の形状でも問題ありません。大切なのは一貫性です。データ収集時と実行時で同じ物体を使い、位置や向きを変えながらデータを集めると、方策(ポリシー)の汎化性能が高まります。
手首(グリッパー)カメラなしで SmolVLA を使えますか?
使えます。SmolVLA はデータセットを記録したときのカメラ構成に適応するため、固定の外部カメラ1台でも動作します。ただし手首カメラは操作中に物体を近くから捉えられるため、通常は把持精度が向上します。どの構成でも、学習時と実行時でカメラ構成を完全に同じに保ってください。
カメラマウントなどの 3D プリント用(STL)ファイルはどこにありますか?
LeRobot で使う SO-100/SO-101 アームはオープンハードウェアで、印刷可能な STL/CAD ファイルは GitHub の SO-ARM100 リポジトリ(TheRobotStudio)にあります。コミュニティ製のカメラマウントは Printables/Thingiverse で共有されていることが多いです。最新のリンクは LeRobot のハードウェアドキュメントをご確認ください。
学習済みの方策を Raspberry Pi やエッジ機器で実行できますか?
SmolVLA は軽量(約4.5億パラメータ)で控えめなハードウェアでも動作しますが、Raspberry Pi の CPU だけでリアルタイム推論を行うと遅くなります。おすすめは SmolVLA の非同期推論で、行動予測と実行を分離します。方策はより高性能なマシン(遠隔でも可)で動かし、ロボット側は滑らかに実行できます。機器上でリアルタイム制御を行うなら、小型 GPU/アクセラレータの利用が望ましいです。
データを記録せず、学習済みの方策を「実行」だけするにはどうすればよいですか?
LeRobot では、評価/推論スクリプトで学習済み方策を実行し、データセットを保存しなければ済みます。記録ループが再利用されるのはロボット制御を担うためで、出力を一時ディレクトリに向ける(後で削除する)か、専用の評価/推論コマンドを使えます。コマンド名はバージョンで変わるため、最新の LeRobot ドキュメントで正確な名称をご確認ください。
どの程度の技術力が必要ですか?コピー&ペーストで動きますか?
標準的な SO-100/SO-101 のワークフローでは、基本的に「コマンドをなぞる」だけで、微調整や付属スクリプトの実行に高度な機械学習のプログラミングは不要です。ただし Python とコマンドラインの基本操作、そしてハードウェアの組み立て・キャリブレーションやドライバ/USB の問題解決のための根気は必要です。始めるにあたって独自のモデルコードを書く必要はありません。
立方体を必ず同じ位置に置くなら、固定軌道を再生すればよく、なぜ AI を使うのですか?
固定軌道は毎回すべてがまったく同じ位置にある場合しか機能せず、変化に対応できません。学習した VLA 方策はカメラ映像を使って、物体の位置・向き・照明の変化に対応し、さまざまな言語指示にも従えます。チュートリアルで位置を固定するのは最初のデモを簡単にするためで、SmolVLA の本当の価値は汎化にあり、それは多様なデータで学習することで得られます。