Cos'è SmolVLA?
Compatto e Potente
SmolVLA è un modello Vision-Language-Action (VLA) all'avanguardia con 2,1 miliardi di parametri, progettato per prestazioni eccezionali in compiti di robotica reali.
Altamente Efficiente
Ottimizzato per GPU di livello consumer, raggiunge velocità di inferenza impressionanti, consentendo un funzionamento in tempo reale su hardware accessibile come la NVIDIA RTX 3090.
Aperto e Accessibile
Sviluppato da Hugging Face e reso open-source, SmolVLA mira a democratizzare la ricerca sulla robotica, rendendo la tecnologia VLA avanzata disponibile a tutti.
Guardalo in azione
Guarda SmolVLA in azione mentre esegue una varietà di compiti che mostrano le sue capacità in un ambiente reale.
Panoramica di SmolVLA

Video di robot fai-da-te della comunità

🚀 Scopri SmolVLA
SmolVLA è un innovativo modello Vision-Language-Action (VLA) con soli 450 milioni di parametri, sviluppato da Hugging Face. È progettato accuratamente per un implementazione conveniente su hardware consumer, rendendo la tecnologia robotica avanzata accessibile a più sviluppatori ed entusiasti.
Addestrato sul dataset comunitario aperto LeRobot, SmolVLA incarna veramente il potere della collaborazione open-source, con prestazioni che eguagliano o superano modelli proprietari più grandi.
Articolo di ricerca ufficiale
Per uno sguardo approfondito ai dettagli tecnici, leggi l'articolo di ricerca ufficiale. Fornisce informazioni complete sull'architettura del modello, la metodologia di addestramento e i benchmark delle prestazioni.
🛠️ Guida rapida
📋 Panoramica del modello
SmolVLA è un modello vision-language-action da 450M parametri progettato per una robotica accessibile ed efficiente. È ottimizzato per funzionare su hardware consumer mantenendo prestazioni competitive.
1. Configurazione dell'ambiente
Prima di procedere, è necessario installare correttamente l'ambiente seguendo la Guida all'installazione nella documentazione.
git clone https://github.com/huggingface/lerobot.git
cd lerobot
pip install -e ".[smolvla]"
2. Caricare il modello pre-addestrato
Il modo più veloce per provare SmolVLA è caricare direttamente il modello pre-addestrato da Hugging Face.
from lerobot.common.policies.smolvla.modeling_smolvla import SmolVLAPolicy
policy = SmolVLAPolicy.from_pretrained("lerobot/smolvla_base")
3. Ottimizzare il modello pre-addestrato
Puoi ottimizzare SmolVLA per il tuo caso d'uso specifico. Consulta la documentazione per ulteriori dettagli.
# Preparare il file di configurazione
config_path = "path/to/your/config.yaml"
# Avviare l'addestramento
python lerobot/scripts/train.py \
--config-path $config_path \
--resume-from lerobot/smolvla_base
4. Valutare il modello
Testa il tuo modello su diverse attività robotiche.
python lerobot/scripts/eval.py \
--policy-path outputs/train/smolvla/checkpoints/last \
--env-name aloha_sim_insertion_human
📊 Risorse aggiuntive
🤝 Modelli ottimizzati dalla comunità
Scopri applicazioni straordinarie create dalla comunità! Questi 29 modelli ottimizzati mostrano la versatilità di SmolVLA in varie attività robotiche.
🧄 Manipolazione aglio
hannanasko/smolvla_so_100_garlic
🚗 Raccolta camion mostro
GhostScientist/smolvla_please_pick_up_the_monster_truck
📝 Lavagna & Luce bici
danielkorth/smolvla-whiteboard-and-bike-light
📊 Esploratore dataset di addestramento
SmolVLA è stato addestrato sul dataset Open-X-Embodiment (OXE) di alta qualità. Esplora i dati di addestramento:
📦 Statistiche del dataset
- Traiettorie totali: 1,4M+
- Piattaforme robotiche: 10+ incarnazioni diverse
- Attività: Pick-and-place, Manipolazione, Navigazione
- Formato dati: Compatibile LeRobot
Vetrina della Comunità
Guarda come la comunità sta utilizzando e adattando SmolVLA per applicazioni nuove ed entusiasmanti.

Risorse
❓ Domande frequenti
Risposte alle domande frequenti sull'uso di SmolVLA con i bracci robotici LeRobot.