Wichtige Merkmale
Kompakt und effizient
Mit nur 495M Parametern läuft SmolVLA reibungslos auf handelsüblicher Consumer-Hardware und senkt die Einstiegshürde für die Robotikforschung und -entwicklung.
Hohe Leistung
Trotz seiner geringen Größe liefert SmolVLA modernste Leistung bei verschiedenen Roboter-Manipulationsaufgaben, vom einfachen Aufnehmen und Ablegen bis hin zu komplexen sequenziellen Operationen.
Open Source
Das Modell sowie sein Trainings- und Evaluierungscode sind vollständig Open Source, was die Zusammenarbeit und Innovation innerhalb der Robotik-Community fördert.
In Aktion erleben
Sehen Sie SmolVLA in Aktion bei der Durchführung verschiedener Aufgaben, die seine Fähigkeiten in einer realen Umgebung demonstrieren.
SmolVLA Überblick

Community DIY-Roboter-Video

🚀 SmolVLA kennenlernen
SmolVLA ist ein bahnbrechendes Vision-Language-Action (VLA) Modell mit nur 450 Millionen Parametern, entwickelt von Hugging Face. Es wurde sorgfältig für den kosteneffektiven Einsatz auf Consumer-Hardware konzipiert und macht fortschrittliche Robotik-Technologie für mehr Entwickler und Enthusiasten zugänglich.
Trainiert auf dem offenen Community-Dataset LeRobot, verkörpert SmolVLA die Kraft der Open-Source-Zusammenarbeit mit einer Leistung, die größere proprietäre Modelle erreicht oder übertrifft.
Offizielle Forschungsarbeit
Für einen detaillierten Einblick in die technischen Details lesen Sie die offizielle Forschungsarbeit. Sie bietet umfassende Informationen zur Modellarchitektur, Trainingsmethodik und Leistungs-Benchmarks.
🛠️ Schnellstart-Anleitung
📋 Modell-Übersicht
SmolVLA ist ein 450M-Parameter Vision-Language-Action-Modell, das für erschwingliche und effiziente Robotik entwickelt wurde. Es ist optimiert, um auf Consumer-Hardware zu laufen und dabei wettbewerbsfähige Leistung zu erzielen.
1. Umgebungseinrichtung
Bevor Sie fortfahren, müssen Sie die Umgebung gemäß der Installationsanleitung in der Dokumentation ordnungsgemäß einrichten.
git clone https://github.com/huggingface/lerobot.git
cd lerobot
pip install -e ".[smolvla]"
2. Vortrainiertes Modell laden
Der schnellste Weg, SmolVLA zu erleben, ist das direkte Laden des vortrainierten Modells von Hugging Face.
from lerobot.common.policies.smolvla.modeling_smolvla import SmolVLAPolicy
policy = SmolVLAPolicy.from_pretrained("lerobot/smolvla_base")
3. Vortrainiertes Modell feinabstimmen
Sie können SmolVLA auf Ihren spezifischen Anwendungsfall feinabstimmen. Weitere Details finden Sie in der Dokumentation.
# Konfigurationsdatei vorbereiten
config_path = "path/to/your/config.yaml"
# Training starten
python lerobot/scripts/train.py \
--config-path $config_path \
--resume-from lerobot/smolvla_base
4. Modell evaluieren
Testen Sie Ihr Modell in verschiedenen Robotik-Aufgaben.
python lerobot/scripts/eval.py \
--policy-path outputs/train/smolvla/checkpoints/last \
--env-name aloha_sim_insertion_human
📊 Weitere Ressourcen
🤝 Von der Community feinabgestimmte Modelle
Entdecken Sie erstaunliche Anwendungen, die von der Community erstellt wurden! Diese 29 feinabgestimmten Modelle zeigen die Vielseitigkeit von SmolVLA über verschiedene Robotik-Aufgaben hinweg.
🧄 Knoblauch-Handhabung
hannanasko/smolvla_so_100_garlic
🚗 Monster-Truck Aufheben
GhostScientist/smolvla_please_pick_up_the_monster_truck
📝 Whiteboard & Fahrradlicht
danielkorth/smolvla-whiteboard-and-bike-light
📊 Trainingsdatensatz-Explorer
SmolVLA wurde auf hochwertigem Open-X-Embodiment (OXE) Datensatz trainiert. Erkunden Sie die Trainingsdaten:
📦 Datensatz-Statistiken
- Gesamttrajektorien: 1,4M+
- Roboter-Plattformen: 10+ verschiedene Embodiments
- Aufgaben: Pick-and-Place, Manipulation, Navigation
- Datenformat: LeRobot-kompatibel
Community-Showcase
Sehen Sie, wie die Community SmolVLA für neue und aufregende Anwendungen nutzt und anpasst.

Ressourcen
❓ Häufig gestellte Fragen
Antworten auf häufige Fragen zur Nutzung von SmolVLA mit LeRobot-Roboterarmen.