Italiano

SmolVLA

Un modello Vision-Language-Action open-source per la robotica moderna

Cos'è SmolVLA?

Compatto e Potente

SmolVLA è un modello Vision-Language-Action (VLA) all'avanguardia con 2,1 miliardi di parametri, progettato per prestazioni eccezionali in compiti di robotica reali.

Altamente Efficiente

Ottimizzato per GPU di livello consumer, raggiunge velocità di inferenza impressionanti, consentendo un funzionamento in tempo reale su hardware accessibile come la NVIDIA RTX 3090.

Aperto e Accessibile

Sviluppato da Hugging Face e reso open-source, SmolVLA mira a democratizzare la ricerca sulla robotica, rendendo la tecnologia VLA avanzata disponibile a tutti.

Guardalo in azione

Guarda SmolVLA in azione mentre esegue una varietà di compiti che mostrano le sue capacità in un ambiente reale.

Panoramica di SmolVLA

Video di robot fai-da-te della comunità

🚀 Scopri SmolVLA

SmolVLA è un innovativo modello Vision-Language-Action (VLA) con soli 450 milioni di parametri, sviluppato da Hugging Face. È progettato accuratamente per un implementazione conveniente su hardware consumer, rendendo la tecnologia robotica avanzata accessibile a più sviluppatori ed entusiasti.

Addestrato sul dataset comunitario aperto LeRobot, SmolVLA incarna veramente il potere della collaborazione open-source, con prestazioni che eguagliano o superano modelli proprietari più grandi.

Articolo di ricerca ufficiale

Per uno sguardo approfondito ai dettagli tecnici, leggi l'articolo di ricerca ufficiale. Fornisce informazioni complete sull'architettura del modello, la metodologia di addestramento e i benchmark delle prestazioni.

🛠️ Guida rapida

📋 Panoramica del modello

SmolVLA è un modello vision-language-action da 450M parametri progettato per una robotica accessibile ed efficiente. È ottimizzato per funzionare su hardware consumer mantenendo prestazioni competitive.

Parametri: 450M
Download: 15.383+ ultimo mese
Modelli ottimizzati: 29 modelli

1. Configurazione dell'ambiente

Prima di procedere, è necessario installare correttamente l'ambiente seguendo la Guida all'installazione nella documentazione.

git clone https://github.com/huggingface/lerobot.git
cd lerobot
pip install -e ".[smolvla]"

2. Caricare il modello pre-addestrato

Il modo più veloce per provare SmolVLA è caricare direttamente il modello pre-addestrato da Hugging Face.

from lerobot.common.policies.smolvla.modeling_smolvla import SmolVLAPolicy
policy = SmolVLAPolicy.from_pretrained("lerobot/smolvla_base")

3. Ottimizzare il modello pre-addestrato

Puoi ottimizzare SmolVLA per il tuo caso d'uso specifico. Consulta la documentazione per ulteriori dettagli.

# Preparare il file di configurazione
config_path = "path/to/your/config.yaml"

# Avviare l'addestramento
python lerobot/scripts/train.py \
  --config-path $config_path \
  --resume-from lerobot/smolvla_base

4. Valutare il modello

Testa il tuo modello su diverse attività robotiche.

python lerobot/scripts/eval.py \
  --policy-path outputs/train/smolvla/checkpoints/last \
  --env-name aloha_sim_insertion_human

📊 Risorse aggiuntive

🤝 Modelli ottimizzati dalla comunità

Scopri applicazioni straordinarie create dalla comunità! Questi 29 modelli ottimizzati mostrano la versatilità di SmolVLA in varie attività robotiche.

Sfoglia tutti i 29 modelli della comunità →

📊 Esploratore dataset di addestramento

SmolVLA è stato addestrato sul dataset Open-X-Embodiment (OXE) di alta qualità. Esplora i dati di addestramento:

📦 Statistiche del dataset

  • Traiettorie totali: 1,4M+
  • Piattaforme robotiche: 10+ incarnazioni diverse
  • Attività: Pick-and-place, Manipolazione, Navigazione
  • Formato dati: Compatibile LeRobot

Esplora il dataset su Hugging Face →

Vetrina della Comunità

Guarda come la comunità sta utilizzando e adattando SmolVLA per applicazioni nuove ed entusiasmanti.

Risorse

❓ Domande frequenti

Risposte alle domande frequenti sull'uso di SmolVLA con i bracci robotici LeRobot.

Quali oggetti posso usare per l'addestramento? La dimensione conta? Va bene un parallelepipedo?
Non esistono specifiche rigide: va bene qualsiasi oggetto che entri nella pinza e sia ben visibile alle telecamere. I tutorial usano spesso un piccolo cubo (circa 2–4 cm) con il braccio SO-100/SO-101; anche parallelepipedi e altre forme vanno bene. L'importante è la coerenza: usa lo stesso oggetto durante la raccolta dati e l'esecuzione, e registra dati con posizioni e orientamenti vari affinché la policy generalizzi meglio.
Posso usare SmolVLA senza una telecamera sul polso (sulla pinza)?
Sì. SmolVLA si adatta alle telecamere con cui registri il dataset, quindi può bastare una singola telecamera esterna fissa. Tuttavia una telecamera sul polso di solito migliora la precisione di presa perché vede l'oggetto da vicino durante la manipolazione. Qualunque configurazione scegli, mantienila identica tra addestramento ed esecuzione.
Dove trovo i file stampabili in 3D (STL), ad esempio per un supporto telecamera?
I bracci SO-100/SO-101 usati con LeRobot sono hardware open source: i file STL/CAD stampabili si trovano nel repository SO-ARM100 su GitHub (TheRobotStudio). I supporti per telecamera creati dalla community sono spesso condivisi su Printables/Thingiverse. Per i link aggiornati consulta la documentazione hardware di LeRobot.
Posso eseguire una policy addestrata su un Raspberry Pi / dispositivo edge?
SmolVLA è leggero (circa 450 milioni di parametri) e gira su hardware modesto, ma l'inferenza in tempo reale sulla sola CPU di un Raspberry Pi sarà lenta. Lo schema consigliato è l'inferenza asincrona di SmolVLA, che separa la previsione dell'azione dall'esecuzione: la policy gira su una macchina più potente (anche remota) mentre il robot esegue in modo fluido. Per il controllo in tempo reale sul dispositivo è preferibile una piccola GPU/acceleratore.
Come faccio solo a « eseguire » una policy addestrata senza registrare dati?
In LeRobot esegui una policy addestrata tramite lo script di valutazione/inferenza e semplicemente non conservi il dataset. Il ciclo di registrazione viene riutilizzato perché gestisce il controllo del robot; puoi indirizzare l'output in una cartella temporanea (o eliminarla dopo), oppure usare il comando dedicato di valutazione/inferenza. Verifica il nome esatto del comando nella documentazione attuale di LeRobot, poiché la CLI cambia tra le versioni.
Che livello tecnico serve? È « copia, incolla ed esegui »?
Per il flusso standard SO-100/SO-101 si tratta soprattutto di « seguire i comandi »: non serve una programmazione ML avanzata per il fine-tuning o per eseguire gli script forniti. Servono però dimestichezza di base con Python e la riga di comando, e pazienza per assemblare e calibrare l'hardware e risolvere problemi di driver/USB. Per iniziare non è richiesto codice di modello personalizzato.
Se il cubo deve stare sempre nello stesso punto, perché usare l'IA invece di riprodurre una traiettoria fissa?
Una traiettoria fissa funziona solo se ogni volta tutto è esattamente nello stesso punto e non sa adattarsi. Una policy VLA appresa usa le immagini delle telecamere per gestire variazioni di posizione, orientamento e illuminazione degli oggetti, e può seguire diverse istruzioni in linguaggio naturale. I tutorial a volte fissano la posizione solo per semplificare la prima dimostrazione; il vero valore di SmolVLA è la generalizzazione, che si ottiene addestrando su dati vari.