Onderzoekers hebben Zero-WAM ontwikkeld, een model waarmee robots manipulatietaken kunnen uitvoeren die ze tijdens hun training nooit hebben gezien. Door gebruik te maken van menselijke video's als instructie, kan de robot nieuwe handelingen begrijpen en toepassen zonder dat de onderliggende parameters van het model aangepast hoeven te worden.
Een centraal probleem binnen de robotica is de zogenaamde 'zero-shot cross-task generalization'. Dit houdt in dat een robot een taak moet kunnen uitvoeren zonder dat deze specifiek in de trainingsdata is opgenomen. In de wereld van grote taalmodellen is dit concept bekend als 'in-context learning' (ICL), waarbij een nieuwe opdracht simpelweg in de tekstuele context wordt beschreven. Volgens een wetenschappelijk artikel op arxiv.org hebben onderzoekers dit principe nu vertaald naar robotische manipulatie.
Video als instructiebron
De makers van Zero-WAM stellen dat taal alleen onvoldoende is voor complexe fysieke handelingen. In plaats daarvan gebruiken zij menselijke video's als de primaire vorm van taakspecificatie. Video's bieden namelijk rijke visuele aanwijzingen over hoe een taak zich in de tijd ontwikkelt, wat essentieel is voor het succesvol uitvoeren van fysieke bewegingen.
Zero-WAM fungeert als een causaal video-actiemodel. Het systeem analyseert de menselijke video en vertaalt deze visuele informatie naar concrete acties die de robot moet ondernemen om het gewenste resultaat te bereiken.
Overwinning van datatekorten met HumanGen
Een grote hindernis bij het trainen van dergelijke modellen is het gebrek aan grote datasets die zowel menselijke video's als bijbehorende robotacties bevatten. Om dit op te lossen, hebben de onderzoekers een automatische pijplijn ontwikkeld. Deze methode zet bestaande robot-trajecten om in semantisch overeenkomstige menselijke video's.
Het resultaat van dit proces is de dataset 'HumanGen'. Volgens de publicatie op bevat deze dataset 74.200 paren van mens-robot ICL-data, verspreid over 8.600 verschillende taken. Om te voorkomen dat het model simpelweg patronen uit bekende taken kopieert, is een specifieke trainingsmethode geïmplementeerd: de 'in-context future chunk prediction' (IFP). Deze techniek dwingt de robot om daadwerkelijk de informatie uit de video-prompt te halen in plaats van te vertrouwen op eerdere trainingen.
Resultaten in simulatie en praktijk
De effectiviteit van Zero-WAM is getest in de RoboTwin 2.0-simulatie. Bij zeven taken die het model nooit eerder had gezien, behaalde Zero-WAM een gemiddeld succespercentage van 47,0%. Dit is een aanzienlijke verbetering ten opzichte van de beste bestaande video-actie baselines, met een absolute stijging van 29,5 procentpunt, zoals vermeld in de documentatie op .
Naast simulaties zijn er ook evaluaties in de echte wereld uitgevoerd. Hierbij bleek het model in staat om menselijke instructievideo's te volgen voor complexe scenario's, waaronder:
* Scènes met meerdere objecten;
* Manipulaties over een langere tijdshorizon;
* Precisiewerk, zoals fijnmazige inserties.
Het onderzoek is op 26 augustus 2026 ingediend door een team bestaande uit onder meer Jiaming Zhou, Qihang Zhang en Gangwei Xu, en is beschikbaar via de . De resultaten suggereren een belangrijke stap richting robots die flexibeler en autonomer kunnen leren van menselijk gedrag zonder dat er voor elke nieuwe taak opnieuw geprogrammeerd hoeft te worden.