Lo sviluppatore di IA robotica Skild AI ha insegnato al modello S1 ad acquisire una nuova complessa attività in più fasi attraverso un singolo video, senza ulteriori addestramenti specifici per l’operazione. La tecnologia è già stata implementata nella produzione industriale: Skild AI, Nvidia e Foxconn utilizzano i manipolatori robotici della famiglia Skild Brain nell’assemblaggio dei sistemi Nvidia Blackwell.
Invece di programmare ogni movimento, l’operatore mostra a S1 come eseguire il lavoro e il modello trasforma ciò che vede in azioni autonome. Gli sviluppatori definiscono questo approccio apprendimento contestuale: l’esempio funge da istruzione per il modello durante l’esecuzione del compito, quindi non è necessario modificare i pesi della rete neurale.
Skild AI ha testato S1 su operazioni non presenti nel set di addestramento. Il robot ha trapiantato una pianta, preparato pancake, preparato caffè con filtro e assemblato un kit di componenti. Alcune sequenze richiedevano fino a dieci minuti e includevano decine di azioni separate. Nell’esperimento di trapianto della pianta, tra la registrazione della dimostrazione e l’inizio del lavoro autonomo del robot sono trascorsi 11 minuti.
Il modello non cerca di riprodurre letteralmente ogni movimento umano. Secondo i dati di Skild AI, S1 identifica l’obiettivo della dimostrazione e adatta le azioni alla situazione attuale. Durante i test, i ricercatori hanno spostato oggetti, modificato l’illuminazione e sostituito alcuni oggetti con altri aventi funzioni simili. Il robot ha continuato a lavorare e, dopo tentativi falliti, ha potuto ripetere l’azione. In un test, invece dell’annaffiatoio mostrato nel video, è stata lasciata una tazza d’acqua e il sistema ha utilizzato la tazza.
Il principale vantaggio di questo approccio emerge quando le operazioni di produzione cambiano frequentemente. Un robot industriale tradizionale richiede spesso un nuovo set di esempi, programmazione o ulteriori addestramenti per una nuova attività. Skild AI afferma che una singola dimostrazione video per S1 nei test ha prodotto risultati comparabili a circa 380 dimostrazioni per un modello ulteriormente addestrato per una nuova attività. La raccolta di un tale volume di registrazioni con il controllo manuale del robot richiedeva da 50 a 100 ore.
Nella produzione, Skild AI applica lo stesso concetto di controllo universale dei robot attraverso la piattaforma Skild Brain. Nvidia descrive il funzionamento di un sistema a due manipolatori che installa una barra conduttrice e un blocco limitatore, poi avvitando 16 viti. Il robot deve lavorare con precisione su componenti, controllare il contatto, ricordare la sequenza delle operazioni e correggere i movimenti se la posizione degli oggetti cambia.
Il sistema robotizzato partecipa all’assemblaggio dell’hardware Nvidia Blackwell presso lo stabilimento Foxconn di Houston. Tuttavia, i materiali pubblicati non affermano che il robot abbia imparato esattamente l’operazione di fabbrica dopo un singolo video: la capacità di apprendimento da una singola dimostrazione si riferisce al modello S1, mentre l’implementazione industriale è descritta più ampiamente come l’uso della piattaforma Skild Brain.
Per l’addestramento, Skild AI combina registrazioni di azioni umane, telecomando di robot, dati reali e simulazioni al computer. Nvidia fornisce l’infrastruttura e gli strumenti Isaac Sim, Isaac Lab, Cosmos e Omniverse, che consentono di creare scene virtuali ed esempi di addestramento sintetici. Questo approccio risolve uno dei principali problemi della robotica moderna: le macchine reali accumulano esperienza molto più lentamente e a costi più elevati rispetto alle modelli linguistiche che ottengono dati testuali da fonti digitali.
Skild AI utilizza già i propri sistemi non solo su banchi di prova sperimentali. Secondo i dati dell’azienda, dieci mesi dopo il primo lancio commerciale, contava oltre 60 clienti paganti nei settori della logistica, produzione, consegna, ispezione di oggetti, centri di elaborazione dati e altre aree. La prossima sfida per gli sviluppatori non è solo insegnare al robot a ripetere ciò che vedono, ma far sì che un singolo modello possa trasferire le competenze accumulate tra diversi tipi di macchine e apprendere nuove operazioni senza una lunga ricalibrazione di ogni linea di produzione.
Carolina Vivianti è consulente/Advisor autonomo in sicurezza informatica con esperienza nel settore tech e security. Ha lavorato come Security Advisor per Ford EU/Ford Motor Company e Vodafone e ha studi presso la Sapienza Università di Roma.
Aree di competenza: Cybersecurity, IT Risk Management, Security Advisory, Threat Analysis, Data Protection, Cloud Security, Compliance & Governance