Qu'est-ce que SmolVLA ?
Compact et Puissant
SmolVLA est un modèle Vision-Langage-Action (VLA) de pointe avec 2,1 milliards de paramètres, conçu pour des performances exceptionnelles sur des tâches de robotique réelles.
Très Efficace
Optimisé pour les GPU grand public, il atteint des vitesses d'inférence impressionnantes, permettant un fonctionnement en temps réel sur du matériel accessible comme le NVIDIA RTX 3090.
Ouvert et Accessible
Développé par Hugging Face et open-source, SmolVLA vise à démocratiser la recherche en robotique, rendant la technologie VLA avancée accessible à tous.
Voir en action
Regardez SmolVLA en action, effectuant une variété de tâches qui mettent en valeur ses capacités dans un environnement réel.
Aperçu de SmolVLA

Vidéo de robot DIY de la communauté

🚀 Découvrez SmolVLA
SmolVLA est un modèle révolutionnaire Vision-Langage-Action (VLA) avec seulement 450 millions de paramètres, développé par Hugging Face. Il est soigneusement conçu pour un déploiement rentable sur du matériel grand public, rendant la technologie robotique avancée accessible à plus de développeurs et d'enthousiastes.
Entraîné sur l'ensemble de données communautaire ouvert LeRobot, SmolVLA incarne véritablement la puissance de la collaboration open-source, avec des performances qui égalent ou dépassent les modèles propriétaires plus grands.
Article de recherche officiel
Pour un examen approfondi des détails techniques, lisez l'article de recherche officiel. Il fournit des informations complètes sur l'architecture du modèle, la méthodologie d'entraînement et les benchmarks de performance.
🛠️ Guide de démarrage rapide
📋 Aperçu du modèle
SmolVLA est un modèle vision-langage-action de 450M paramètres conçu pour une robotique abordable et efficace. Il est optimisé pour fonctionner sur du matériel grand public tout en maintenant des performances compétitives.
1. Configuration de l'environnement
Avant de continuer, vous devez installer correctement l'environnement en suivant le Guide d'installation dans la documentation.
git clone https://github.com/huggingface/lerobot.git
cd lerobot
pip install -e ".[smolvla]"
2. Charger le modèle pré-entraîné
Le moyen le plus rapide de découvrir SmolVLA est de charger directement le modèle pré-entraîné depuis Hugging Face.
from lerobot.common.policies.smolvla.modeling_smolvla import SmolVLAPolicy
policy = SmolVLAPolicy.from_pretrained("lerobot/smolvla_base")
3. Affiner le modèle pré-entraîné
Vous pouvez affiner SmolVLA sur votre cas d'usage spécifique. Consultez la documentation pour plus de détails.
# Préparer le fichier de configuration
config_path = "path/to/your/config.yaml"
# Démarrer l'entraînement
python lerobot/scripts/train.py \
--config-path $config_path \
--resume-from lerobot/smolvla_base
4. Évaluer le modèle
Testez votre modèle sur différentes tâches robotiques.
python lerobot/scripts/eval.py \
--policy-path outputs/train/smolvla/checkpoints/last \
--env-name aloha_sim_insertion_human
📊 Ressources supplémentaires
🤝 Modèles affinés par la communauté
Découvrez des applications étonnantes créées par la communauté ! Ces 29 modèles affinés démontrent la polyvalence de SmolVLA dans diverses tâches robotiques.
🧄 Manipulation d'ail
hannanasko/smolvla_so_100_garlic
🚗 Ramassage de camion monstre
GhostScientist/smolvla_please_pick_up_the_monster_truck
📝 Tableau blanc & Lumière de vélo
danielkorth/smolvla-whiteboard-and-bike-light
📊 Explorateur d'ensemble de données d'entraînement
SmolVLA a été entraîné sur l'ensemble de données Open-X-Embodiment (OXE) de haute qualité. Explorez les données d'entraînement :
📦 Statistiques de l'ensemble de données
- Trajectoires totales: 1,4M+
- Plateformes robotiques: 10+ incarnations différentes
- Tâches: Préhension-et-placement, Manipulation, Navigation
- Format des données: Compatible LeRobot
Vitrine de la Communauté
Découvrez comment la communauté utilise et adapte SmolVLA pour des applications nouvelles et passionnantes.

Ressources
❓ Foire aux questions
Réponses aux questions fréquentes sur l'utilisation de SmolVLA avec les bras robotiques LeRobot.