Français

SmolVLA

Un modèle Vision-Langage-Action open-source pour la robotique moderne

Qu'est-ce que SmolVLA ?

Compact et Puissant

SmolVLA est un modèle Vision-Langage-Action (VLA) de pointe avec 2,1 milliards de paramètres, conçu pour des performances exceptionnelles sur des tâches de robotique réelles.

Très Efficace

Optimisé pour les GPU grand public, il atteint des vitesses d'inférence impressionnantes, permettant un fonctionnement en temps réel sur du matériel accessible comme le NVIDIA RTX 3090.

Ouvert et Accessible

Développé par Hugging Face et open-source, SmolVLA vise à démocratiser la recherche en robotique, rendant la technologie VLA avancée accessible à tous.

Voir en action

Regardez SmolVLA en action, effectuant une variété de tâches qui mettent en valeur ses capacités dans un environnement réel.

Aperçu de SmolVLA

Vidéo de robot DIY de la communauté

🚀 Découvrez SmolVLA

SmolVLA est un modèle révolutionnaire Vision-Langage-Action (VLA) avec seulement 450 millions de paramètres, développé par Hugging Face. Il est soigneusement conçu pour un déploiement rentable sur du matériel grand public, rendant la technologie robotique avancée accessible à plus de développeurs et d'enthousiastes.

Entraîné sur l'ensemble de données communautaire ouvert LeRobot, SmolVLA incarne véritablement la puissance de la collaboration open-source, avec des performances qui égalent ou dépassent les modèles propriétaires plus grands.

Article de recherche officiel

Pour un examen approfondi des détails techniques, lisez l'article de recherche officiel. Il fournit des informations complètes sur l'architecture du modèle, la méthodologie d'entraînement et les benchmarks de performance.

🛠️ Guide de démarrage rapide

📋 Aperçu du modèle

SmolVLA est un modèle vision-langage-action de 450M paramètres conçu pour une robotique abordable et efficace. Il est optimisé pour fonctionner sur du matériel grand public tout en maintenant des performances compétitives.

Paramètres: 450M
Téléchargements: 15 383+ le mois dernier
Modèles affinés: 29 modèles

1. Configuration de l'environnement

Avant de continuer, vous devez installer correctement l'environnement en suivant le Guide d'installation dans la documentation.

git clone https://github.com/huggingface/lerobot.git
cd lerobot
pip install -e ".[smolvla]"

2. Charger le modèle pré-entraîné

Le moyen le plus rapide de découvrir SmolVLA est de charger directement le modèle pré-entraîné depuis Hugging Face.

from lerobot.common.policies.smolvla.modeling_smolvla import SmolVLAPolicy
policy = SmolVLAPolicy.from_pretrained("lerobot/smolvla_base")

3. Affiner le modèle pré-entraîné

Vous pouvez affiner SmolVLA sur votre cas d'usage spécifique. Consultez la documentation pour plus de détails.

# Préparer le fichier de configuration
config_path = "path/to/your/config.yaml"

# Démarrer l'entraînement
python lerobot/scripts/train.py \
  --config-path $config_path \
  --resume-from lerobot/smolvla_base

4. Évaluer le modèle

Testez votre modèle sur différentes tâches robotiques.

python lerobot/scripts/eval.py \
  --policy-path outputs/train/smolvla/checkpoints/last \
  --env-name aloha_sim_insertion_human

📊 Ressources supplémentaires

🤝 Modèles affinés par la communauté

Découvrez des applications étonnantes créées par la communauté ! Ces 29 modèles affinés démontrent la polyvalence de SmolVLA dans diverses tâches robotiques.

Parcourir les 29 modèles communautaires →

📊 Explorateur d'ensemble de données d'entraînement

SmolVLA a été entraîné sur l'ensemble de données Open-X-Embodiment (OXE) de haute qualité. Explorez les données d'entraînement :

📦 Statistiques de l'ensemble de données

  • Trajectoires totales: 1,4M+
  • Plateformes robotiques: 10+ incarnations différentes
  • Tâches: Préhension-et-placement, Manipulation, Navigation
  • Format des données: Compatible LeRobot

Explorer l'ensemble de données sur Hugging Face →

Vitrine de la Communauté

Découvrez comment la communauté utilise et adapte SmolVLA pour des applications nouvelles et passionnantes.

Ressources

❓ Foire aux questions

Réponses aux questions fréquentes sur l'utilisation de SmolVLA avec les bras robotiques LeRobot.

Quels objets puis-je utiliser pour l'entraînement ? La taille compte-t-elle ? Un parallélépipède convient-il ?
Il n'y a pas de spécification stricte : tout objet qui tient dans la pince et reste bien visible par les caméras convient. Les tutoriels utilisent souvent un petit cube (environ 2 à 4 cm) avec le bras SO-100/SO-101 ; les parallélépipèdes et autres formes conviennent aussi. L'essentiel est la cohérence : utilisez le même objet lors de la collecte des données et de l'exécution, et enregistrez des données avec des positions et orientations variées pour que la politique généralise mieux.
Puis-je utiliser SmolVLA sans caméra de poignet (sur la pince) ?
Oui. SmolVLA s'adapte aux caméras avec lesquelles vous enregistrez votre jeu de données ; une seule caméra externe fixe peut donc suffire. Cela dit, une caméra de poignet améliore généralement la précision de préhension car elle voit l'objet de près pendant la manipulation. Quelle que soit la configuration, gardez-la identique entre l'entraînement et l'exécution.
Où trouver des fichiers imprimables en 3D (STL), par exemple pour un support de caméra ?
Les bras SO-100/SO-101 utilisés avec LeRobot sont du matériel open source : les fichiers STL/CAO imprimables se trouvent dans le dépôt SO-ARM100 sur GitHub (TheRobotStudio). Les supports de caméra créés par la communauté sont souvent partagés sur Printables/Thingiverse. Consultez la documentation matérielle de LeRobot pour les liens à jour.
Puis-je exécuter une politique entraînée sur un Raspberry Pi / appareil embarqué ?
SmolVLA est léger (environ 450 M de paramètres) et fonctionne sur du matériel modeste, mais l'inférence en temps réel sur le seul CPU d'un Raspberry Pi sera lente. Le schéma recommandé est l'inférence asynchrone de SmolVLA, qui sépare la prédiction d'action de l'exécution : la politique tourne sur une machine plus puissante (voire distante) pendant que le robot exécute de façon fluide. Pour un contrôle en temps réel embarqué, un petit GPU/accélérateur est préférable.
Comment simplement « exécuter » une politique entraînée sans enregistrer de données ?
Dans LeRobot, vous exécutez une politique entraînée via le script d'évaluation/inférence et ne conservez tout simplement pas le jeu de données. La boucle d'enregistrement est réutilisée car elle gère le contrôle du robot ; vous pouvez diriger la sortie vers un dossier temporaire (ou le supprimer ensuite), ou utiliser la commande d'évaluation/inférence dédiée. Vérifiez le nom exact de la commande dans la documentation LeRobot actuelle, car l'interface en ligne de commande évolue selon les versions.
Quel niveau technique faut-il ? Est-ce du « copier-coller et exécuter » ?
Pour le flux standard SO-100/SO-101, il s'agit surtout de « suivre les commandes » : aucun développement ML poussé n'est nécessaire pour affiner ou exécuter les scripts fournis. Il faut toutefois être à l'aise avec Python et la ligne de commande, et faire preuve de patience pour assembler et calibrer le matériel et résoudre les problèmes de pilotes/USB. Aucun code de modèle personnalisé n'est requis pour débuter.
Si le cube doit toujours être au même endroit, pourquoi utiliser l'IA plutôt que rejouer une trajectoire fixe ?
Une trajectoire fixe ne fonctionne que si tout se trouve exactement au même endroit à chaque fois et ne peut pas s'adapter. Une politique VLA apprise utilise l'image des caméras pour gérer les variations de position, d'orientation et d'éclairage des objets, et peut suivre différentes instructions en langage naturel. Les tutoriels fixent parfois la position uniquement pour simplifier une première démonstration ; la vraie valeur de SmolVLA réside dans la généralisation, que l'on obtient en s'entraînant sur des données variées.