Deutsch

SmolVLA

Ein Open-Source Vision-Language-Action-Modell für moderne Robotik

Wichtige Merkmale

Kompakt und effizient

Mit nur 495M Parametern läuft SmolVLA reibungslos auf handelsüblicher Consumer-Hardware und senkt die Einstiegshürde für die Robotikforschung und -entwicklung.

Hohe Leistung

Trotz seiner geringen Größe liefert SmolVLA modernste Leistung bei verschiedenen Roboter-Manipulationsaufgaben, vom einfachen Aufnehmen und Ablegen bis hin zu komplexen sequenziellen Operationen.

Open Source

Das Modell sowie sein Trainings- und Evaluierungscode sind vollständig Open Source, was die Zusammenarbeit und Innovation innerhalb der Robotik-Community fördert.

In Aktion erleben

Sehen Sie SmolVLA in Aktion bei der Durchführung verschiedener Aufgaben, die seine Fähigkeiten in einer realen Umgebung demonstrieren.

SmolVLA Überblick

Community DIY-Roboter-Video

🚀 SmolVLA kennenlernen

SmolVLA ist ein bahnbrechendes Vision-Language-Action (VLA) Modell mit nur 450 Millionen Parametern, entwickelt von Hugging Face. Es wurde sorgfältig für den kosteneffektiven Einsatz auf Consumer-Hardware konzipiert und macht fortschrittliche Robotik-Technologie für mehr Entwickler und Enthusiasten zugänglich.

Trainiert auf dem offenen Community-Dataset LeRobot, verkörpert SmolVLA die Kraft der Open-Source-Zusammenarbeit mit einer Leistung, die größere proprietäre Modelle erreicht oder übertrifft.

Offizielle Forschungsarbeit

Für einen detaillierten Einblick in die technischen Details lesen Sie die offizielle Forschungsarbeit. Sie bietet umfassende Informationen zur Modellarchitektur, Trainingsmethodik und Leistungs-Benchmarks.

🛠️ Schnellstart-Anleitung

📋 Modell-Übersicht

SmolVLA ist ein 450M-Parameter Vision-Language-Action-Modell, das für erschwingliche und effiziente Robotik entwickelt wurde. Es ist optimiert, um auf Consumer-Hardware zu laufen und dabei wettbewerbsfähige Leistung zu erzielen.

Parameter: 450M
Downloads: 15.383+ letzter Monat
Feinabgestimmte Modelle: 29 Modelle

1. Umgebungseinrichtung

Bevor Sie fortfahren, müssen Sie die Umgebung gemäß der Installationsanleitung in der Dokumentation ordnungsgemäß einrichten.

git clone https://github.com/huggingface/lerobot.git
cd lerobot
pip install -e ".[smolvla]"

2. Vortrainiertes Modell laden

Der schnellste Weg, SmolVLA zu erleben, ist das direkte Laden des vortrainierten Modells von Hugging Face.

from lerobot.common.policies.smolvla.modeling_smolvla import SmolVLAPolicy
policy = SmolVLAPolicy.from_pretrained("lerobot/smolvla_base")

3. Vortrainiertes Modell feinabstimmen

Sie können SmolVLA auf Ihren spezifischen Anwendungsfall feinabstimmen. Weitere Details finden Sie in der Dokumentation.

# Konfigurationsdatei vorbereiten
config_path = "path/to/your/config.yaml"

# Training starten
python lerobot/scripts/train.py \
  --config-path $config_path \
  --resume-from lerobot/smolvla_base

4. Modell evaluieren

Testen Sie Ihr Modell in verschiedenen Robotik-Aufgaben.

python lerobot/scripts/eval.py \
  --policy-path outputs/train/smolvla/checkpoints/last \
  --env-name aloha_sim_insertion_human

📊 Weitere Ressourcen

🤝 Von der Community feinabgestimmte Modelle

Entdecken Sie erstaunliche Anwendungen, die von der Community erstellt wurden! Diese 29 feinabgestimmten Modelle zeigen die Vielseitigkeit von SmolVLA über verschiedene Robotik-Aufgaben hinweg.

Alle 29 Community-Modelle durchsuchen →

📊 Trainingsdatensatz-Explorer

SmolVLA wurde auf hochwertigem Open-X-Embodiment (OXE) Datensatz trainiert. Erkunden Sie die Trainingsdaten:

📦 Datensatz-Statistiken

  • Gesamttrajektorien: 1,4M+
  • Roboter-Plattformen: 10+ verschiedene Embodiments
  • Aufgaben: Pick-and-Place, Manipulation, Navigation
  • Datenformat: LeRobot-kompatibel

Datensatz auf Hugging Face erkunden →

Community-Showcase

Sehen Sie, wie die Community SmolVLA für neue und aufregende Anwendungen nutzt und anpasst.

Ressourcen

❓ Häufig gestellte Fragen

Antworten auf häufige Fragen zur Nutzung von SmolVLA mit LeRobot-Roboterarmen.

Welche Objekte kann ich zum Training verwenden? Spielt die Größe eine Rolle? Geht auch ein Quader?
Es gibt keine strengen Vorgaben – jedes Objekt, das in den Greifer passt und für die Kameras gut sichtbar ist, funktioniert. In Tutorials wird mit dem SO-100/SO-101-Arm oft ein kleiner Würfel (etwa 2–4 cm) verwendet; Quader und andere Formen sind ebenfalls in Ordnung. Wichtig ist Konsistenz: Verwenden Sie beim Aufzeichnen der Daten und bei der Ausführung dasselbe Objekt und nehmen Sie Daten mit variierenden Positionen und Ausrichtungen auf, damit die Policy besser generalisiert.
Kann ich SmolVLA ohne Handgelenk- bzw. Greiferkamera nutzen?
Ja. SmolVLA passt sich an die Kameras an, mit denen Sie Ihren Datensatz aufnehmen, sodass auch eine einzelne feste externe Kamera funktioniert. Eine Handgelenkkamera verbessert jedoch meist die Greifpräzision, da sie das Objekt während der Manipulation aus der Nähe sieht. Halten Sie die Kamerakonfiguration bei Training und Ausführung stets identisch.
Wo finde ich 3D-druckbare (STL-)Dateien, z. B. für eine Kamerahalterung?
Die mit LeRobot genutzten SO-100/SO-101-Arme sind Open Hardware – die druckbaren STL-/CAD-Dateien liegen im SO-ARM100-Repository auf GitHub (TheRobotStudio). Von der Community erstellte Kamerahalterungen werden oft auf Printables/Thingiverse geteilt. Die aktuellen Links finden Sie in der LeRobot-Hardware-Dokumentation.
Kann ich eine trainierte Policy auf einem Raspberry Pi / Edge-Gerät ausführen?
SmolVLA ist leichtgewichtig (ca. 450 Mio. Parameter) und läuft auf bescheidener Hardware, aber Echtzeit-Inferenz allein auf einer Raspberry-Pi-CPU ist langsam. Empfohlen wird SmolVLAs asynchrone Inferenz, die Aktionsvorhersage und Ausführung trennt: Die Policy läuft auf einer leistungsfähigeren (auch entfernten) Maschine, während der Roboter flüssig ausführt. Für Echtzeitsteuerung direkt auf dem Gerät ist eine kleine GPU/ein Beschleuniger vorzuziehen.
Wie führe ich eine trainierte Policy nur aus, ohne Daten aufzuzeichnen?
In LeRobot führen Sie eine trainierte Policy über das Evaluierungs-/Inferenzskript aus und behalten den Datensatz einfach nicht. Die Aufnahmeschleife wird wiederverwendet, weil sie die Robotersteuerung übernimmt; Sie können die Ausgabe in ein temporäres Verzeichnis lenken (oder später löschen) oder den dedizierten Eval-/Inferenzbefehl nutzen. Den genauen Befehlsnamen entnehmen Sie der aktuellen LeRobot-Dokumentation, da sich die CLI zwischen Versionen ändert.
Welches technische Niveau brauche ich? Ist es einfach „Kopieren, Einfügen, Ausführen“?
Beim Standard-Workflow für SO-100/SO-101 heißt es weitgehend „den Befehlen folgen“ – für das Fine-Tuning oder das Ausführen der mitgelieferten Skripte brauchen Sie keine tiefe ML-Programmierung. Grundkenntnisse in Python und auf der Kommandozeile sollten Sie mitbringen, ebenso Geduld beim Zusammenbau und Kalibrieren der Hardware und beim Beheben von Treiber-/USB-Problemen. Eigener Modellcode ist für den Einstieg nicht nötig.
Wenn der Würfel immer an derselben Stelle liegen muss – warum dann KI statt eine feste Trajektorie abzuspielen?
Eine feste Trajektorie funktioniert nur, wenn jedes Mal alles an exakt derselben Stelle liegt, und kann sich nicht anpassen. Eine gelernte VLA-Policy nutzt das Kamerabild, um mit wechselnden Objektpositionen, -ausrichtungen und Lichtverhältnissen umzugehen, und kann verschiedenen Sprachbefehlen folgen. In Tutorials wird die Position nur fixiert, um die erste Demo einfach zu halten – der eigentliche Wert von SmolVLA liegt in der Generalisierung, die Sie durch Training mit vielfältigen Daten erreichen.